Байесовская нейронная сеть

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Новая: {{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником ~~~~}} '''Байесовская нейро...)
 
(3 промежуточные версии не показаны)
Строка 1: Строка 1:
-
{{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 18:21, 11 июля 2026 (MSD)}}
+
{{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 17:51, 19 июля 2026 (MSD).
 +
Промпты и описание редакторской проверки приведены в [[Обсуждение:Байесовская нейронная сеть]].
 +
}}
 +
{{TOCright}}
-
'''Байесовская нейронная сеть''' (англ. ''Bayesian neural network'', BNN) — [[Нейронная сеть|нейронная сеть]], в которой параметры рассматриваются не как один фиксированный набор чисел, а как случайные величины с распределением вероятностей. Такой подход позволяет получать не только предсказание, но и оценку неопределённости этого предсказания.
+
'''Байесовская нейронная сеть''' (англ. ''Bayesian neural network'', BNN) — вероятностная модель на основе [[нейронная сеть|нейронной сети]], в которой задаётся априорное распределение параметров и после наблюдения данных выполняется байесовский вывод об их апостериорном распределении. Предсказание получают усреднением по этому распределению, а не подстановкой единственного набора весов.
-
В обычной нейронной сети после обучения веса фиксируются. Модель может выдать высокую вероятность класса даже на объекте, сильно отличающемся от обучающих данных. Байесовская нейронная сеть пытается учитывать, насколько данные определяют параметры модели и насколько устойчиво предсказание к неопределённости в этих параметрах. Это особенно важно в задачах с высокой ценой ошибки: медицине, автономных системах, прогнозировании риска, научных вычисления и [[Активное обучение|активном обучении]].
+
Такой подход позволяет описывать неопределённость параметров и функций, совместимых с обучающими данными. Однако наличие распределения весов само по себе не гарантирует хорошо откалиброванную или надёжную неопределённость: результат зависит от правдоподобия, априорного распределения, качества приближённого вывода и соответствия вероятностной модели реальному процессу.
-
 
+
-
{{TOCright}}
+
== Основная идея ==
== Основная идея ==
-
Пусть <tex>\mathcal D=\{(x_i,y_i)\}_{i=1}^{n}</tex> — обучающая выборка, а <tex>w</tex> — все веса и смещения нейронной сети. В стандартном подходе находят один набор параметров <tex>\hat w</tex>, например минимизируя функцию потерь:
+
Пусть <tex>\mathcal D=\{(x_i,y_i)\}_{i=1}^{n}</tex> — обучающая выборка, а <tex>w</tex> — веса и смещения сети. В обычном обучении выбирают одну оценку параметров, например
-
::<tex>\hat w = \mathop{\arg\min}_{w} \sum_{i=1}^{n} \ell\bigl(y_i,f_w(x_i)\bigr).</tex>
+
::<tex>\hat w=\arg\min_w\sum_{i=1}^{n}\ell\bigl(y_i,f_w(x_i)\bigr).</tex>
-
В байесовском подходе задают априорное распределение весов <tex>p(w)</tex>. После наблюдения данных оно обновляется по формуле Байеса:
+
В байесовской модели задают априорное распределение <tex>p(w)</tex> и правдоподобие <tex>p(\mathcal D\mid w)</tex>. По формуле Байеса апостериорное распределение равно
-
::<tex>p(w\mid\mathcal D)=\frac{p(\mathcal D\mid w)p(w)}{p(\mathcal D)}.</tex>
+
::<tex>p(w\mid\mathcal D)=\frac{p(\mathcal D\mid w)p(w)}{p(\mathcal D)},</tex>
-
Здесь <tex>p(\mathcal D\mid w)</tex> — правдоподобие данных при фиксированных весах, а
+
где маргинальное правдоподобие, или свидетельство модели, имеет вид
-
::<tex>p(\mathcal D)=\int p(\mathcal D\mid w)p(w)\,dw</tex>
+
::<tex>p(\mathcal D)=\int p(\mathcal D\mid w)p(w)\,dw.</tex>
-
— нормирующая константа, называемая маргинальным правдоподобием.
+
Для нового объекта <tex>x_*</tex> предиктивное распределение получают интегрированием по параметрам:
-
Для нового объекта <tex>x_*</tex> интересует не ответ одной сети, а предиктивное распределение:
+
::<tex>p(y_*\mid x_*,\mathcal D)=\int p(y_*\mid x_*,w)p(w\mid\mathcal D)\,dw.</tex>
-
::<tex>p(y_*\mid x_*,\mathcal D)=\int p(y_*\mid x_*,w)\,p(w\mid\mathcal D)\,dw.</tex>
+
BNN тем самым выполняет байесовское усреднение прогнозов множества сетей с общей архитектурой и разными весами. Это не означает равномерного усреднения: больший вклад получают параметры с большей апостериорной вероятностью.
-
Таким образом, байесовская нейронная сеть усредняет прогнозы по множеству возможных параметров, правдоподобных с учётом данных и априорных предположений.
+
== Вероятностная модель наблюдений ==
-
== Неопределённость предсказания ==
+
Распределение весов — только одна часть модели. Необходимо также определить, как выход сети задаёт распределение наблюдаемой цели.
-
Вероятностный вывод нейронной сети полезен прежде всего тем, что позволяет различать источники неопределённости.
+
В регрессии часто предполагают
-
=== Неопределённость данных ===
+
::<tex>y_i=f_w(x_i)+\varepsilon_i,\qquad \varepsilon_i\sim\mathcal N(0,\sigma^2),</tex>
-
'''Неопределённость данных''' (англ. ''aleatoric uncertainty'') возникает из-за случайности, шума измерений или неполноты признаков. Например, два пациента с одинаковыми наблюдаемыми характеристиками могут иметь разные исходы заболевания, поскольку часть причин остаётся ненаблюдаемой.
+
либо позволяют сети предсказывать зависящую от входа дисперсию <tex>\sigma^2(x_i)</tex>. В классификации выходные логиты преобразуют в вероятности классов, например функцией softmax, и задают категориальное правдоподобие.
-
Такая неопределённость не обязательно исчезает при увеличении обучающей выборки: она может быть свойством самой задачи.
+
Неправильно выбранное правдоподобие может дать плохую оценку неопределённости даже при точном выводе о весах. Например, постоянная дисперсия в регрессии не описывает ситуацию, когда шум наблюдений меняется с <tex>x</tex>.
-
=== Неопределённость модели ===
+
== Виды неопределённости ==
-
'''Неопределённость модели''' (англ. ''epistemic uncertainty'') связана с недостатком данных или с тем, что объект находится вне области, хорошо покрытой обучающей выборкой. В этом случае разные наборы весов, согласующиеся с данными, могут давать разные предсказания.
+
=== Алеаторическая неопределённость ===
-
При появлении дополнительных репрезентативных данных эпистемическая неопределённость в принципе может уменьшаться. Именно она особенно интересна при обнаружении объектов вне распределения обучения и при выборе наиболее информативных объектов для разметки.
+
'''Алеаторическая неопределённость''' (англ. ''aleatoric uncertainty'', неопределённость данных) связана со случайностью наблюдений, шумом измерений или отсутствием существенных признаков. Два объекта с одинаковыми наблюдаемыми характеристиками могут иметь разные исходы, поскольку часть причин не измеряется.
-
=== Почему вероятность класса недостаточна ===
+
Эта неопределённость не обязана исчезать при увеличении обучающей выборки. Она задаётся прежде всего моделью правдоподобия и может быть постоянной либо зависеть от входа.<ref name="kendall2017">{{статья |автор=Kendall A., Gal Y. |заглавие=What Uncertainties Do We Need in Bayesian Deep Learning for Computer Vision? |издание=Advances in Neural Information Processing Systems |год=2017 |том=30 |ссылка статьи=https://proceedings.neurips.cc/paper_files/paper/2017/hash/2650d6089a6d640c5e85b2b88265dc2b-Abstract.html}}</ref>
-
Вероятность, выдаваемая классификатором, не всегда является хорошей оценкой уверенности. Обычная сеть может сообщить, что вероятность класса равна <tex>0.99</tex>, хотя объект находится далеко от обучающих данных. Байесовская модель тоже не получает автоматической гарантии корректной неопределённости, но её устройство позволяет явно оценивать разброс прогнозов при различных допустимых параметрах.
+
=== Эпистемическая неопределённость ===
-
Для классификации, например, можно вычислять предсказание несколько раз с различными выборками весов <tex>w^{(1)},\ldots,w^{(S)}</tex> и усреднять вероятности:
+
'''Эпистемическая неопределённость''' (англ. ''epistemic uncertainty'', неопределённость модели) возникает, когда данных недостаточно, чтобы однозначно определить подходящую функцию. Разные значения весов, согласующиеся с наблюдениями, тогда дают различные прогнозы.
-
::<tex>p(y_*=c\mid x_*,\mathcal D)\approx \frac{1}{S}\sum_{s=1}^{S}p(y_*=c\mid x_*,w^{(s)}).</tex>
+
При поступлении репрезентативных данных эпистемическая неопределённость в принципе может уменьшаться. Однако это утверждение относится к корректно специфицированной модели и адекватному выводу: приближённая BNN может оставаться чрезмерно уверенной за пределами обучающего распределения.
-
Большой разброс между отдельными прогнозами указывает на существенную неопределённость параметров.
+
=== Разложение предиктивной дисперсии ===
-
== Априорные распределения весов ==
+
В регрессии два источника можно связать законом полной дисперсии:
-
Перед обучением необходимо выбрать априорное распределение <tex>p(w)</tex>. Часто используют независимое нормальное распределение:
+
::<tex>\mathrm{Var}(Y_*\mid x_*,\mathcal D)=\mathbb E_{p(w\mid\mathcal D)}\left[\mathrm{Var}(Y_*\mid x_*,w)\right]+\mathrm{Var}_{p(w\mid\mathcal D)}\left(\mathbb E[Y_*\mid x_*,w]\right).</tex>
-
::<tex>w_j\sim\mathcal N(0,\sigma^2).</tex>
+
Первое слагаемое отражает средний условный шум данных, второе — разброс условных средних при разных весах. Практическая оценка такого разложения зависит от выбранного правдоподобия и приближения к апостериорному распределению.
-
Такое предположение выражает предпочтение к весам небольшой величины. Оно связано с [[Регуляризация (математика)|регуляризацией]]: если искать не всё распределение, а наиболее вероятный набор параметров, логарифм априорного распределения даёт штраф за слишком большие веса.
+
=== Вероятность класса и неопределённость ===
-
Априорное распределение — не просто техническая деталь. При малом количестве данных оно заметно влияет на результат. Слишком сильный априор может чрезмерно ограничить модель, а слишком слабый — почти не защищать от переобучения. В глубоких сетях также применяют иерархические и структурированные априоры, учитывающие слои, группы параметров или тип архитектуры.
+
Высокая максимальная вероятность softmax не доказывает, что объект хорошо поддержан обучающими данными. Обычная сеть может выдать значение, близкое к единице, далеко от области обучения. BNN позволяет учитывать разброс прогнозов по весам, но также не получает автоматической гарантии обнаружения объектов вне распределения.
-
== Почему точный вывод труден ==
+
Для классификации апостериорную вероятность класса приближают выборками <tex>w^{(1)},\ldots,w^{(S)}</tex>:
-
Для линейных моделей некоторые байесовские интегралы можно вычислить аналитически. У нейронной сети зависимость выхода от весов нелинейна, а число параметров может достигать миллионов или миллиардов. Поэтому точное вычисление распределения
+
::<tex>p(y_*=c\mid x_*,\mathcal D)\approx\frac{1}{S}\sum_{s=1}^{S}p(y_*=c\mid x_*,w^{(s)}).</tex>
-
::<tex>p(w\mid\mathcal D)</tex>
+
Разброс отдельных вероятностей характеризует чувствительность к параметрам, но его следует отличать от энтропии усреднённого предиктивного распределения: эти показатели отвечают на разные вопросы.
-
и интеграла для предиктивного распределения обычно вычислительно неосуществимо.
+
== Априорные распределения ==
-
На практике используют приближённый байесовский вывод. Он не устраняет неопределённость полностью, а строит приближение к истинному апостериорному распределению. Качество этого приближения зависит от метода, архитектуры, объёма данных и выбранного семейства распределений.
+
Часто веса считают независимо нормально распределёнными:
-
== Вариационный вывод ==
+
::<tex>w_j\sim\mathcal N(0,\sigma^2).</tex>
-
При '''вариационном выводе''' выбирают семейство приближённых распределений <tex>q_\theta(w)</tex> с параметрами <tex>\theta</tex> и подбирают его так, чтобы оно было близко к истинному апостериорному распределению.
+
Такой априор выражает предпочтение к небольшим весам. Если вместо полного распределения искать максимум апостериорной вероятности (MAP), отрицательный логарифм нормального априора приводит к квадратичному штрафу, сходному с <tex>L_2</tex>-[[Регуляризация|регуляризацией]]. MAP-оценка при этом остаётся одним набором параметров и сама по себе не выполняет байесовского усреднения.
-
Обычно максимизируют нижнюю границу логарифма маргинального правдоподобия — ELBO (англ. ''evidence lower bound''):
+
Независимый нормальный априор удобен, но не обязательно соответствует разумному распределению функций сети. Масштаб весов взаимодействует с глубиной, шириной и функциями активации. Поэтому применяют послойные, иерархические и структурированные априоры, а также формулировки, задающие желаемые свойства непосредственно в пространстве функций.
-
::<tex>\mathcal L(\theta)=
+
При малом объёме данных априор особенно заметно влияет на результат. Слишком концентрированный априор способен подавить полезные функции, а чрезмерно широкий — приводить к нереалистичному поведению вне обучающей области.
-
\mathbb E_{q_\theta(w)}[\log p(\mathcal D\mid w)]
+
-
-
+
-
\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w)\bigr).</tex>
+
-
Первое слагаемое поощряет хорошее описание данных, а второе ограничивает отклонение приближённого распределения от априорного. Минимизация отрицательной ELBO эквивалентна поиску компромисса между качеством подгонки и сложностью модели.
+
== Почему требуется приближённый вывод ==
-
Простейшее приближение предполагает независимость параметров:
+
В нейронной сети выход нелинейно зависит от большого числа параметров. Нормирующая константа <tex>p(\mathcal D)</tex> требует интегрирования по высокоразмерному пространству, а апостериорное распределение может быть многомодальным и сильно коррелированным. Поэтому точный вывод обычно недоступен.
-
::<tex>q_\theta(w)=\prod_j \mathcal N(w_j\mid\mu_j,\sigma_j^2).</tex>
+
Приближённый метод должен решать две разные задачи: найти области высокой апостериорной вероятности и представить достаточно важную часть их геометрии. Хорошая точность среднего прогноза не доказывает, что апостериорная неопределённость восстановлена правильно.
-
Его называют среднеполевым (англ. ''mean-field'') приближением. Оно удобно вычислительно, но не отражает корреляции между весами. Из-за этого оценка неопределённости может быть слишком грубой.
+
== Вариационный вывод ==
-
== Bayes by Backprop ==
+
При '''вариационном выводе''' выбирают семейство распределений <tex>q_\theta(w)</tex> и минимизируют расхождение с истинным апостериорным распределением. Для стандартного направления дивергенции Кульбака—Лейблера это эквивалентно максимизации нижней границы логарифма свидетельства (ELBO):
-
Метод '''Bayes by Backprop''' обучает параметры вариационного распределения с помощью [[Метод обратного распространения ошибки|обратного распространения ошибки]]. Вместо одного веса хранят, например, среднее <tex>\mu_j</tex> и масштаб <tex>\sigma_j</tex> распределения.
+
::<tex>\mathcal L(\theta)=\mathbb E_{q_\theta(w)}\left[\log p(\mathcal D\mid w)\right]-\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w)\bigr).</tex>
 +
 
 +
Первое слагаемое поощряет объяснение данных, второе штрафует отклонение приближённого распределения от априорного. Разность между <tex>\log p(\mathcal D)</tex> и ELBO равна <tex>\mathrm{KL}(q_\theta(w)\,\|\,p(w\mid\mathcal D))</tex>.
 +
 
 +
В среднеполевом приближении параметры считаются независимыми:
 +
 
 +
::<tex>q_\theta(w)=\prod_j\mathcal N(w_j\mid\mu_j,\sigma_j^2).</tex>
 +
 
 +
Такое семейство масштабируется лучше полного ковариационного распределения, но не отражает корреляции и несколько удалённых мод апостериора. Минимизация <tex>\mathrm{KL}(q\,\|\,p)</tex> часто предпочитает покрыть одну моду и способна дать слишком узкую оценку неопределённости.
 +
 
 +
== Bayes by Backprop ==
-
Для возможности дифференцирования применяют репараметризацию:
+
'''Bayes by Backprop''' — метод вариационного обучения распределения весов с помощью [[метод обратного распространения ошибки|обратного распространения ошибки]]. Для диагонального гауссовского приближения выборку веса записывают через репараметризацию:
::<tex>w_j=\mu_j+\sigma_j\varepsilon_j,\qquad \varepsilon_j\sim\mathcal N(0,1).</tex>
::<tex>w_j=\mu_j+\sigma_j\varepsilon_j,\qquad \varepsilon_j\sim\mathcal N(0,1).</tex>
-
Случайность при этом переносится в переменную <tex>\varepsilon_j</tex>, не зависящую от параметров <tex>\mu_j</tex> и <tex>\sigma_j</tex>. Это даёт возможность использовать стохастический градиентный спуск для оптимизации вариационной цели.<ref name="blundell2015">{{книга
+
Случайность переносится в <tex>\varepsilon_j</tex>, распределение которой не зависит от вариационных параметров. Это позволяет получать стохастические оценки градиента ELBO по <tex>\mu_j</tex> и <tex>\sigma_j</tex>.<ref name="blundell2015">{{статья |автор=Blundell C., Cornebise J., Kavukcuoglu K., Wierstra D. |заглавие=Weight Uncertainty in Neural Network |издание=Proceedings of the 32nd International Conference on Machine Learning |год=2015 |том=37 |страницы=1613–1622 |ссылка статьи=https://proceedings.mlr.press/v37/blundell15.html}}</ref>
-
|автор= Blundell C., Cornebise J., Kavukcuoglu K., Wierstra D.
+
-
|заглавие= Weight Uncertainty in Neural Networks
+
-
|издание= Proceedings of the 32nd International Conference on Machine Learning
+
-
|серия= Proceedings of Machine Learning Research
+
-
|том= 37
+
-
|год= 2015
+
-
|страницы= 1613—1622
+
-
|url= https://proceedings.mlr.press/v37/blundell15.html
+
-
}}</ref>
+
-
Преимущество подхода — совместимость с привычным обучением глубоких сетей. Недостаток — вычислительная стоимость: вместо одного параметра обычно нужно хранить несколько параметров распределения, а для устойчивой оценки предсказания требуется несколько проходов сети.
+
Метод совместим с мини-пакетами и привычными оптимизаторами глубокого обучения. При этом число хранимых параметров для диагонального гауссовского семейства примерно удваивается, а оценка градиента и предсказания содержит шум Монте-Карло.
-
== Монте-Карло dropout ==
+
== Аппроксимация Лапласа ==
-
'''Монте-Карло dropout''' (MC dropout) — практический способ приблизить байесовский вывод в сети с [[Dropout|dropout]]. При стандартном обучении dropout случайно зануляет часть активаций и служит регуляризацией. В MC dropout случайность сохраняют также на этапе предсказания.
+
Аппроксимация Лапласа сначала находит MAP-оценку <tex>\hat w</tex>, а затем приближает логарифм апостериорной плотности квадратичной функцией в её окрестности. В результате получают гауссовское приближение
 +
 
 +
::<tex>p(w\mid\mathcal D)\approx\mathcal N(\hat w,H^{-1}),</tex>
 +
 
 +
где <tex>H</tex> матрица кривизны отрицательного логарифма апостериорной плотности. Такая запись предполагает невырожденную положительно определённую матрицу; на практике кривизну часто демпфируют или регуляризуют. Полная матрица для большой сети слишком дорога, поэтому используют диагональные, блочные, кронекеровские и низкоранговые приближения.
 +
 
 +
Метод удобен как дополнение к уже обученной сети, но локальное гауссовское распределение не описывает далёкие моды и сложную глобальную геометрию апостериора.
 +
 
 +
== Монте-Карло dropout ==
-
Для одного объекта сеть запускают <tex>S</tex> раз с различными масками dropout:
+
'''Монте-Карло dropout''' (MC dropout) — способ получать случайные прогнозы сети с [[Dropout|dropout]], сохраняя dropout включённым на этапе вывода. Для одного объекта выполняют <tex>S</tex> проходов с разными масками:
::<tex>\hat y^{(1)},\hat y^{(2)},\ldots,\hat y^{(S)}.</tex>
::<tex>\hat y^{(1)},\hat y^{(2)},\ldots,\hat y^{(S)}.</tex>
-
Среднее значение оценивают как
+
Выборочное среднее равно
::<tex>\bar y=\frac{1}{S}\sum_{s=1}^{S}\hat y^{(s)},</tex>
::<tex>\bar y=\frac{1}{S}\sum_{s=1}^{S}\hat y^{(s)},</tex>
-
а разброс прогнозов можно использовать как приближение неопределённости:
+
а для скалярного выхода дисперсия случайных прогнозов оценивается как
-
::<tex>\widehat{\mathrm{Var}}(y)=
+
::<tex>\widehat{\mathrm{Var}}_{\mathrm{MC}}(\hat y)=\frac{1}{S-1}\sum_{s=1}^{S}\left(\hat y^{(s)}-\bar y\right)^2.</tex>
-
\frac{1}{S-1}\sum_{s=1}^{S}\left(\hat y^{(s)}-\bar y\right)^2.</tex>
+
-
Gal и Ghahramani показали, что такая процедура может интерпретироваться как вариационное приближение в байесовской модели.<ref name="gal2016">{{книга
+
Для векторного выхода вместо этой формулы используют выборочную ковариационную матрицу. Gal и Ghahramani интерпретировали обучение сети с dropout как определённое вариационное приближение в вероятностной модели, связанной с глубоким гауссовским процессом.<ref name="gal2016">{{статья |автор=Gal Y., Ghahramani Z. |заглавие=Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning |издание=Proceedings of the 33rd International Conference on Machine Learning |год=2016 |том=48 |страницы=1050–1059 |ссылка статьи=https://proceedings.mlr.press/v48/gal16.html}}</ref>
-
|автор= Gal Y., Ghahramani Z.
+
-
|заглавие= Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning
+
-
|издание= Proceedings of the 33rd International Conference on Machine Learning
+
-
|серия= Proceedings of Machine Learning Research
+
-
|том= 48
+
-
|год= 2016
+
-
|страницы= 1050—1059
+
-
|url= https://proceedings.mlr.press/v48/gal16.html
+
-
}}</ref>
+
-
MC dropout часто используют из-за простоты, но его нельзя считать точным апостериорным выводом для произвольной нейронной сети. Результат зависит от вероятности dropout, числа проходов и того, насколько предположения метода соответствуют конкретной модели.
+
Разброс проходов отражает вариативность, создаваемую выбранным приближением, но не обязательно полную предиктивную дисперсию. В регрессии к нему может потребоваться добавить оценку условного шума наблюдений. Результат зависит от расположения и вероятности dropout, режима обучения, числа проходов и соответствия теоретических предпосылок архитектуре. MC dropout нельзя считать точной выборкой из апостериора произвольной сети.
-
== Выборка по Марковским цепям ==
+
== Методы Монте-Карло по марковским цепям ==
-
Другой подход — методы Монте-Карло по марковским цепям (MCMC). Они строят последовательность выборок весов, которая при определённых условиях приближается к апостериорному распределению <tex>p(w\mid\mathcal D)</tex>.
+
Методы Монте-Карло по марковским цепям (MCMC) строят зависимую последовательность значений весов, стационарным распределением которой при выполнении условий является апостериорное <tex>p(w\mid\mathcal D)</tex>. Для нейронных сетей применяют, в частности, гамильтоновский метод Монте-Карло и стохастическую градиентную ланжевеновскую динамику (SGLD). Последняя заменяет полный градиент оценкой по мини-пакету и добавляет гауссовский шум.<ref name="sgld2011">{{статья |автор=Welling M., Teh Y. W. |заглавие=Bayesian Learning via Stochastic Gradient Langevin Dynamics |издание=Proceedings of the 28th International Conference on Machine Learning |год=2011 |страницы=681–688 |ссылка статьи=https://www.cs.toronto.edu/~hinton/absps/WellingTeh2011.pdf}}</ref>
-
Теоретически такие методы могут давать более точное описание сложного распределения параметров, чем простое вариационное семейство. Однако для современных глубоких нейронных сетей MCMC обычно требует большого числа итераций, осторожной настройки и значительных вычислительных ресурсов. Поэтому в прикладных системах чаще используют вариационный вывод, MC dropout или ансамбли моделей.
+
MCMC не ограничивает апостериор заранее выбранным простым вариационным семейством, однако теоретическая асимптотическая корректность не гарантирует достаточного перемешивания за конечный бюджет. Высокая размерность, симметрии параметров, множество мод и стоимость проходов по данным затрудняют диагностику сходимости современных глубоких сетей. Для SGLD теоретические гарантии связаны с режимом убывающего шага, а постоянный шаг создаёт дискретизационное смещение.
-
== Байесовская нейронная сеть и ансамбль ==
+
== Приближения по траектории оптимизации ==
-
[[Ансамбль методов|Ансамбль]] обычных нейронных сетей также позволяет оценивать разброс предсказаний. Несколько сетей обучают с разными начальными значениями, подвыборками данных или настройками, а затем усредняют их ответы.
+
Некоторые методы строят распределение параметров по сохранённым точкам траектории стохастической оптимизации. Например, SWAG аппроксимирует локальную область распределением с диагональной и низкоранговой ковариацией, после чего использует выборки весов для усреднения прогнозов.<ref name="swag2019">{{статья |автор=Maddox W. J., Izmailov P., Garipov T., Vetrov D. P., Wilson A. G. |заглавие=A Simple Baseline for Bayesian Uncertainty in Deep Learning |издание=Advances in Neural Information Processing Systems |год=2019 |том=32 |ссылка статьи=https://proceedings.neurips.cc/paper_files/paper/2019/hash/118921efba23fc329e6560b27861f0c2-Abstract.html}}</ref>
-
Ансамбль и байесовская сеть решают сходную практическую задачу, но концептуально различаются.
+
Такие методы масштабируются лучше полного MCMC, но остаются аппроксимациями и обычно описывают ограниченную область пространства параметров.
-
* В байесовской нейронной сети стремятся моделировать распределение параметров одной вероятностной модели.
+
== Байесовская сеть и ансамбль ==
-
* В ансамбле используют несколько отдельно обученных моделей; он не обязан быть приближением единого апостериорного распределения.
+
-
* Ансамбли часто дают сильное практическое качество, но требуют хранить и запускать несколько полноценных сетей.
+
-
* Вариационные байесовские методы экономнее ансамбля при хранении, но могут недооценивать неопределённость из-за ограниченного семейства <tex>q_\theta(w)</tex>.
+
-
Выбор между этими подходами зависит от требований к качеству, вычислительной стоимости, интерпретации неопределённости и скорости ответа системы.
+
[[Ансамбль алгоритмов|Глубокий ансамбль]] состоит из нескольких независимо обученных нейронных сетей. Различие их прогнозов также используется для оценки неопределённости.
-
== Применения ==
+
* В BNN задаются априор, правдоподобие и процедура приближения апостериорного распределения одной вероятностной модели.
 +
* Ансамбль объединяет отдельно полученные модели и не обязан быть выборкой из единого апостериора.
 +
* Ансамбли легко обучать параллельно и они служат сильной практической базовой линией для неопределённости.<ref name="ensemble2017">{{статья |автор=Lakshminarayanan B., Pritzel A., Blundell C. |заглавие=Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles |издание=Advances in Neural Information Processing Systems |год=2017 |том=30 |ссылка статьи=https://proceedings.neurips.cc/paper_files/paper/2017/hash/9ef2ed4b7fd2c810847ffa5fa85bce38-Abstract.html}}</ref>
 +
* Полный ансамбль требует хранить и запускать несколько сетей; простое вариационное приближение может быть компактнее, но способно недооценивать неопределённость.
-
=== Регрессия ===
+
Ни название «байесовский», ни наличие ансамбля не позволяют заранее определить, какой метод лучше откалиброван на конкретной задаче. Требуется прямое экспериментальное сравнение при одинаковом вычислительном бюджете.
-
В регрессионной задаче модель может возвращать не только точечную оценку <tex>\hat y</tex>, но и интервал неопределённости. Например, при прогнозировании спроса широкий интервал означает, что решение о запасах должно учитывать более высокий риск ошибки.
+
== Оценка качества неопределённости ==
-
Важно различать доверительный интервал параметров и предиктивный интервал будущего наблюдения. Последний должен учитывать как неопределённость модели, так и случайность самих данных.
+
Точность предсказаний и качество неопределённости — разные свойства. Для оценки используют:
-
=== Классификация и обнаружение неизвестных объектов ===
+
* отрицательное логарифмическое правдоподобие и другие строгие правила оценки вероятностного прогноза;
 +
* оценку Брайера для классификации;
 +
* диаграммы надёжности и показатели калибровки;
 +
* покрытие и ширину предиктивных интервалов в регрессии;
 +
* селективный риск при отказе модели от части решений;
 +
* поведение при контролируемом распределительном сдвиге и на неизвестных классах.
-
В классификации байесовские методы применяют, когда нужно не только выбрать класс, но и определить, насколько модель уверена в этом выборе. В частности, полезно выявлять объекты, не похожие на обучающие данные: редкие состояния оборудования, новые типы документов или необычные медицинские изображения.
+
Одна агрегированная мера калибровки может скрывать ошибки в редких подгруппах или при сдвиге данных. Проверку проводят отдельно на эксплуатационно важных режимах. Нельзя оценивать метод только по тому, что его неопределённость возрастает на одном специально выбранном наборе объектов вне распределения.
-
Однако высокая неопределённость не является готовым решением задачи обнаружения объектов вне распределения. Для надёжной работы необходимы проверка на соответствующих тестовых данных, калибровка вероятностей и продуманное правило передачи случая человеку-эксперту.
+
== Применения ==
-
=== Активное обучение ===
+
=== Регрессия ===
-
В [[Активное обучение|активном обучении]] система выбирает объекты, разметка которых ожидаемо сильнее всего улучшит модель. Байесовская нейронная сеть может отдавать приоритет объектам с высокой эпистемической неопределённостью: если разные допустимые наборы параметров дают разные ответы, дополнительная разметка может оказаться особенно ценной.
+
В регрессии BNN возвращает предиктивное распределение или интервалы, учитывающие выбранную модель шума и неопределённость параметров. При ненулевом условном шуме предиктивный интервал будущего наблюдения обычно шире интервала условного среднего, поскольку включает алеаторическую составляющую.
 +
 
 +
=== Классификация и неизвестные объекты ===
 +
 
 +
В классификации неопределённость используют для отказа от решения, передачи объекта эксперту и выявления режимов, слабо поддержанных обучающими данными. Однако высокая неопределённость не является готовым детектором объектов вне распределения, а низкая — доказательством принадлежности обучающему распределению.
 +
 
 +
=== Активное обучение ===
-
=== Безопасные и ответственные решения ===
+
В [[активное обучение|активном обучении]] система выбирает объекты, разметка которых ожидаемо наиболее полезна. Для этого применяют показатели эпистемической неопределённости или ожидаемого изменения апостериорного распределения. Простая отправка на разметку всех объектов с максимальной энтропией может преимущественно выбирать неразрешимый шум, поэтому функция приобретения должна соответствовать цели обучения.
-
В системах с высокой стоимостью ошибки неопределённость может использоваться как сигнал для отказа от автоматического решения. Например, модель не ставит диагноз самостоятельно, а передаёт случай врачу; система управления снижает скорость; антифрод отправляет операцию на дополнительную проверку.
+
=== Решения с возможностью отказа ===
-
Такой механизм требует организационного процесса: нужно заранее определить пороги, ответственного человека и действия после сигнала. Число, названное «неопределённостью», само по себе не делает систему безопасной.
+
В задачах с высокой ценой ошибки неопределённость может служить одним из сигналов для передачи решения человеку, дополнительного измерения или перехода в безопасный режим. Для этого заранее задают стоимость ошибок и отказов, проверяют пороги на отложенных данных и определяют действия после сигнала. Число, названное «неопределённостью», само по себе не делает систему безопасной.
== Ограничения ==
== Ограничения ==
Строка 192: Строка 200:
Байесовская нейронная сеть не гарантирует правильной уверенности автоматически.
Байесовская нейронная сеть не гарантирует правильной уверенности автоматически.
-
* Истинное апостериорное распределение обычно недоступно, поэтому используются приближения.
+
* Апостериорное распределение почти всегда заменяется приближением, качество которого трудно проверить в большой модели.
-
* Вариационное приближение может искусственно сузить распределение и недооценить неопределённость.
+
* Среднеполевой вариационный вывод не отражает корреляции и несколько мод и может недооценивать неопределённость.
-
* Априорные предположения влияют на результат, особенно при малом объёме данных.
+
* Априор и правдоподобие влияют на прогноз, особенно при малом объёме данных и вне обучающей области.
-
* Проверка неопределённости требует отдельной оценки: например, анализа калибровки и поведения на новых режимах данных.
+
* Разные параметризации одной функции могут порождать сложные симметрии в пространстве весов.
-
* Несколько выборок весов увеличивают время предсказания.
+
* Несколько выборок увеличивают стоимость обучения или вывода; малое число выборок добавляет ошибку Монте-Карло.
-
* Неопределённость модели не заменяет анализ причинности, качества данных и [[Объяснимый искусственный интеллект|интерпретируемости]] решения.
+
* Хорошая калибровка на исходном тестовом распределении не гарантирует калибровку после сдвига данных.
 +
* Эпистемическая и алеаторическая неопределённости не всегда однозначно разделимы при неверно специфицированной модели.
 +
* Неопределённость не заменяет контроль качества данных, причинный анализ и содержательную проверку решения.
-
Кроме того, байесовская интерпретация зависит от модели вероятностей. Если важный фактор отсутствует среди признаков или данные систематически искажены, формально корректный вывод внутри модели не означает корректного вывода о реальном мире.
+
Если важный фактор отсутствует среди признаков, правила сбора данных систематически искажены или реальный процесс не входит в класс модели, формально последовательный вывод внутри BNN может оставаться неверным описанием мира.
== Философский аспект ==
== Философский аспект ==
-
Байесовская нейронная сеть важна не только как технический метод. Она подчёркивает различие между утверждением «модель выдала ответ» и утверждением «для этого ответа достаточно оснований». Вместо единственного оптимального набора параметров рассматривается множество гипотез, совместимых с наблюдениями.
+
Байесовская нейронная сеть подчёркивает различие между утверждением «модель выдала ответ» и утверждением «для этого ответа достаточно оснований». Вместо одной оценки параметров рассматривается распределение гипотез, совместимых с данными и априорными предположениями.
-
Такой подход ближе к представлению знания как степени обоснованности, а не как набора окончательных ответов. Однако вероятностная форма не освобождает разработчика от ответственности за выбор данных, модели, априорных предположений и способа применения результата.
+
Однако вероятностная форма не устраняет человеческий выбор. Разработчик задаёт пространство моделей, априор, правдоподобие, метод приближения и правило принятия решения. Поэтому численная неопределённость выражает степень уверенности внутри выбранной модели, а не универсальную меру незнания о реальном мире.
== См. также ==
== См. также ==
Строка 212: Строка 222:
* [[Машинное обучение]]
* [[Машинное обучение]]
* [[Байесовский вывод]]
* [[Байесовский вывод]]
-
* [[Регуляризация (математика)]]
+
* [[Регуляризация]]
* [[Dropout]]
* [[Dropout]]
-
* [[Ансамбль методов]]
+
* [[Ансамбль алгоритмов]]
* [[Активное обучение]]
* [[Активное обучение]]
-
* [[Объяснимый искусственный интеллект]]
 
== Литература ==
== Литература ==
Строка 223: Строка 232:
{{DEFAULTSORT:Байесовская нейронная сеть}}
{{DEFAULTSORT:Байесовская нейронная сеть}}
-
[[Категория:Искусственный интеллект]]
+
[[Категория:Машинное обучение]]
 +
[[Категория:Нейронные сети]]

Текущая версия

Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 17:51, 19 июля 2026 (MSD).

Промпты и описание редакторской проверки приведены в Обсуждение:Байесовская нейронная сеть.


Содержание

Байесовская нейронная сеть (англ. Bayesian neural network, BNN) — вероятностная модель на основе нейронной сети, в которой задаётся априорное распределение параметров и после наблюдения данных выполняется байесовский вывод об их апостериорном распределении. Предсказание получают усреднением по этому распределению, а не подстановкой единственного набора весов.

Такой подход позволяет описывать неопределённость параметров и функций, совместимых с обучающими данными. Однако наличие распределения весов само по себе не гарантирует хорошо откалиброванную или надёжную неопределённость: результат зависит от правдоподобия, априорного распределения, качества приближённого вывода и соответствия вероятностной модели реальному процессу.

Основная идея

Пусть \mathcal D=\{(x_i,y_i)\}_{i=1}^{n} — обучающая выборка, а w — веса и смещения сети. В обычном обучении выбирают одну оценку параметров, например

\hat w=\arg\min_w\sum_{i=1}^{n}\ell\bigl(y_i,f_w(x_i)\bigr).

В байесовской модели задают априорное распределение p(w) и правдоподобие p(\mathcal D\mid w). По формуле Байеса апостериорное распределение равно

p(w\mid\mathcal D)=\frac{p(\mathcal D\mid w)p(w)}{p(\mathcal D)},

где маргинальное правдоподобие, или свидетельство модели, имеет вид

p(\mathcal D)=\int p(\mathcal D\mid w)p(w)\,dw.

Для нового объекта x_* предиктивное распределение получают интегрированием по параметрам:

p(y_*\mid x_*,\mathcal D)=\int p(y_*\mid x_*,w)p(w\mid\mathcal D)\,dw.

BNN тем самым выполняет байесовское усреднение прогнозов множества сетей с общей архитектурой и разными весами. Это не означает равномерного усреднения: больший вклад получают параметры с большей апостериорной вероятностью.

Вероятностная модель наблюдений

Распределение весов — только одна часть модели. Необходимо также определить, как выход сети задаёт распределение наблюдаемой цели.

В регрессии часто предполагают

y_i=f_w(x_i)+\varepsilon_i,\qquad \varepsilon_i\sim\mathcal N(0,\sigma^2),

либо позволяют сети предсказывать зависящую от входа дисперсию \sigma^2(x_i). В классификации выходные логиты преобразуют в вероятности классов, например функцией softmax, и задают категориальное правдоподобие.

Неправильно выбранное правдоподобие может дать плохую оценку неопределённости даже при точном выводе о весах. Например, постоянная дисперсия в регрессии не описывает ситуацию, когда шум наблюдений меняется с x.

Виды неопределённости

Алеаторическая неопределённость

Алеаторическая неопределённость (англ. aleatoric uncertainty, неопределённость данных) связана со случайностью наблюдений, шумом измерений или отсутствием существенных признаков. Два объекта с одинаковыми наблюдаемыми характеристиками могут иметь разные исходы, поскольку часть причин не измеряется.

Эта неопределённость не обязана исчезать при увеличении обучающей выборки. Она задаётся прежде всего моделью правдоподобия и может быть постоянной либо зависеть от входа.[1]

Эпистемическая неопределённость

Эпистемическая неопределённость (англ. epistemic uncertainty, неопределённость модели) возникает, когда данных недостаточно, чтобы однозначно определить подходящую функцию. Разные значения весов, согласующиеся с наблюдениями, тогда дают различные прогнозы.

При поступлении репрезентативных данных эпистемическая неопределённость в принципе может уменьшаться. Однако это утверждение относится к корректно специфицированной модели и адекватному выводу: приближённая BNN может оставаться чрезмерно уверенной за пределами обучающего распределения.

Разложение предиктивной дисперсии

В регрессии два источника можно связать законом полной дисперсии:

\mathrm{Var}(Y_*\mid x_*,\mathcal D)=\mathbb E_{p(w\mid\mathcal D)}\left[\mathrm{Var}(Y_*\mid x_*,w)\right]+\mathrm{Var}_{p(w\mid\mathcal D)}\left(\mathbb E[Y_*\mid x_*,w]\right).

Первое слагаемое отражает средний условный шум данных, второе — разброс условных средних при разных весах. Практическая оценка такого разложения зависит от выбранного правдоподобия и приближения к апостериорному распределению.

Вероятность класса и неопределённость

Высокая максимальная вероятность softmax не доказывает, что объект хорошо поддержан обучающими данными. Обычная сеть может выдать значение, близкое к единице, далеко от области обучения. BNN позволяет учитывать разброс прогнозов по весам, но также не получает автоматической гарантии обнаружения объектов вне распределения.

Для классификации апостериорную вероятность класса приближают выборками w^{(1)},\ldots,w^{(S)}:

p(y_*=c\mid x_*,\mathcal D)\approx\frac{1}{S}\sum_{s=1}^{S}p(y_*=c\mid x_*,w^{(s)}).

Разброс отдельных вероятностей характеризует чувствительность к параметрам, но его следует отличать от энтропии усреднённого предиктивного распределения: эти показатели отвечают на разные вопросы.

Априорные распределения

Часто веса считают независимо нормально распределёнными:

w_j\sim\mathcal N(0,\sigma^2).

Такой априор выражает предпочтение к небольшим весам. Если вместо полного распределения искать максимум апостериорной вероятности (MAP), отрицательный логарифм нормального априора приводит к квадратичному штрафу, сходному с L_2-регуляризацией. MAP-оценка при этом остаётся одним набором параметров и сама по себе не выполняет байесовского усреднения.

Независимый нормальный априор удобен, но не обязательно соответствует разумному распределению функций сети. Масштаб весов взаимодействует с глубиной, шириной и функциями активации. Поэтому применяют послойные, иерархические и структурированные априоры, а также формулировки, задающие желаемые свойства непосредственно в пространстве функций.

При малом объёме данных априор особенно заметно влияет на результат. Слишком концентрированный априор способен подавить полезные функции, а чрезмерно широкий — приводить к нереалистичному поведению вне обучающей области.

Почему требуется приближённый вывод

В нейронной сети выход нелинейно зависит от большого числа параметров. Нормирующая константа p(\mathcal D) требует интегрирования по высокоразмерному пространству, а апостериорное распределение может быть многомодальным и сильно коррелированным. Поэтому точный вывод обычно недоступен.

Приближённый метод должен решать две разные задачи: найти области высокой апостериорной вероятности и представить достаточно важную часть их геометрии. Хорошая точность среднего прогноза не доказывает, что апостериорная неопределённость восстановлена правильно.

Вариационный вывод

При вариационном выводе выбирают семейство распределений q_\theta(w) и минимизируют расхождение с истинным апостериорным распределением. Для стандартного направления дивергенции Кульбака—Лейблера это эквивалентно максимизации нижней границы логарифма свидетельства (ELBO):

\mathcal L(\theta)=\mathbb E_{q_\theta(w)}\left[\log p(\mathcal D\mid w)\right]-\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w)\bigr).

Первое слагаемое поощряет объяснение данных, второе штрафует отклонение приближённого распределения от априорного. Разность между \log p(\mathcal D) и ELBO равна \mathrm{KL}(q_\theta(w)\,\|\,p(w\mid\mathcal D)).

В среднеполевом приближении параметры считаются независимыми:

q_\theta(w)=\prod_j\mathcal N(w_j\mid\mu_j,\sigma_j^2).

Такое семейство масштабируется лучше полного ковариационного распределения, но не отражает корреляции и несколько удалённых мод апостериора. Минимизация \mathrm{KL}(q\,\|\,p) часто предпочитает покрыть одну моду и способна дать слишком узкую оценку неопределённости.

Bayes by Backprop

Bayes by Backprop — метод вариационного обучения распределения весов с помощью обратного распространения ошибки. Для диагонального гауссовского приближения выборку веса записывают через репараметризацию:

w_j=\mu_j+\sigma_j\varepsilon_j,\qquad \varepsilon_j\sim\mathcal N(0,1).

Случайность переносится в \varepsilon_j, распределение которой не зависит от вариационных параметров. Это позволяет получать стохастические оценки градиента ELBO по \mu_j и \sigma_j.[1]

Метод совместим с мини-пакетами и привычными оптимизаторами глубокого обучения. При этом число хранимых параметров для диагонального гауссовского семейства примерно удваивается, а оценка градиента и предсказания содержит шум Монте-Карло.

Аппроксимация Лапласа

Аппроксимация Лапласа сначала находит MAP-оценку \hat w, а затем приближает логарифм апостериорной плотности квадратичной функцией в её окрестности. В результате получают гауссовское приближение

p(w\mid\mathcal D)\approx\mathcal N(\hat w,H^{-1}),

где H — матрица кривизны отрицательного логарифма апостериорной плотности. Такая запись предполагает невырожденную положительно определённую матрицу; на практике кривизну часто демпфируют или регуляризуют. Полная матрица для большой сети слишком дорога, поэтому используют диагональные, блочные, кронекеровские и низкоранговые приближения.

Метод удобен как дополнение к уже обученной сети, но локальное гауссовское распределение не описывает далёкие моды и сложную глобальную геометрию апостериора.

Монте-Карло dropout

Монте-Карло dropout (MC dropout) — способ получать случайные прогнозы сети с dropout, сохраняя dropout включённым на этапе вывода. Для одного объекта выполняют S проходов с разными масками:

\hat y^{(1)},\hat y^{(2)},\ldots,\hat y^{(S)}.

Выборочное среднее равно

\bar y=\frac{1}{S}\sum_{s=1}^{S}\hat y^{(s)},

а для скалярного выхода дисперсия случайных прогнозов оценивается как

\widehat{\mathrm{Var}}_{\mathrm{MC}}(\hat y)=\frac{1}{S-1}\sum_{s=1}^{S}\left(\hat y^{(s)}-\bar y\right)^2.

Для векторного выхода вместо этой формулы используют выборочную ковариационную матрицу. Gal и Ghahramani интерпретировали обучение сети с dropout как определённое вариационное приближение в вероятностной модели, связанной с глубоким гауссовским процессом.[1]

Разброс проходов отражает вариативность, создаваемую выбранным приближением, но не обязательно полную предиктивную дисперсию. В регрессии к нему может потребоваться добавить оценку условного шума наблюдений. Результат зависит от расположения и вероятности dropout, режима обучения, числа проходов и соответствия теоретических предпосылок архитектуре. MC dropout нельзя считать точной выборкой из апостериора произвольной сети.

Методы Монте-Карло по марковским цепям

Методы Монте-Карло по марковским цепям (MCMC) строят зависимую последовательность значений весов, стационарным распределением которой при выполнении условий является апостериорное p(w\mid\mathcal D). Для нейронных сетей применяют, в частности, гамильтоновский метод Монте-Карло и стохастическую градиентную ланжевеновскую динамику (SGLD). Последняя заменяет полный градиент оценкой по мини-пакету и добавляет гауссовский шум.[1]

MCMC не ограничивает апостериор заранее выбранным простым вариационным семейством, однако теоретическая асимптотическая корректность не гарантирует достаточного перемешивания за конечный бюджет. Высокая размерность, симметрии параметров, множество мод и стоимость проходов по данным затрудняют диагностику сходимости современных глубоких сетей. Для SGLD теоретические гарантии связаны с режимом убывающего шага, а постоянный шаг создаёт дискретизационное смещение.

Приближения по траектории оптимизации

Некоторые методы строят распределение параметров по сохранённым точкам траектории стохастической оптимизации. Например, SWAG аппроксимирует локальную область распределением с диагональной и низкоранговой ковариацией, после чего использует выборки весов для усреднения прогнозов.[1]

Такие методы масштабируются лучше полного MCMC, но остаются аппроксимациями и обычно описывают ограниченную область пространства параметров.

Байесовская сеть и ансамбль

Глубокий ансамбль состоит из нескольких независимо обученных нейронных сетей. Различие их прогнозов также используется для оценки неопределённости.

  • В BNN задаются априор, правдоподобие и процедура приближения апостериорного распределения одной вероятностной модели.
  • Ансамбль объединяет отдельно полученные модели и не обязан быть выборкой из единого апостериора.
  • Ансамбли легко обучать параллельно и они служат сильной практической базовой линией для неопределённости.[1]
  • Полный ансамбль требует хранить и запускать несколько сетей; простое вариационное приближение может быть компактнее, но способно недооценивать неопределённость.

Ни название «байесовский», ни наличие ансамбля не позволяют заранее определить, какой метод лучше откалиброван на конкретной задаче. Требуется прямое экспериментальное сравнение при одинаковом вычислительном бюджете.

Оценка качества неопределённости

Точность предсказаний и качество неопределённости — разные свойства. Для оценки используют:

  • отрицательное логарифмическое правдоподобие и другие строгие правила оценки вероятностного прогноза;
  • оценку Брайера для классификации;
  • диаграммы надёжности и показатели калибровки;
  • покрытие и ширину предиктивных интервалов в регрессии;
  • селективный риск при отказе модели от части решений;
  • поведение при контролируемом распределительном сдвиге и на неизвестных классах.

Одна агрегированная мера калибровки может скрывать ошибки в редких подгруппах или при сдвиге данных. Проверку проводят отдельно на эксплуатационно важных режимах. Нельзя оценивать метод только по тому, что его неопределённость возрастает на одном специально выбранном наборе объектов вне распределения.

Применения

Регрессия

В регрессии BNN возвращает предиктивное распределение или интервалы, учитывающие выбранную модель шума и неопределённость параметров. При ненулевом условном шуме предиктивный интервал будущего наблюдения обычно шире интервала условного среднего, поскольку включает алеаторическую составляющую.

Классификация и неизвестные объекты

В классификации неопределённость используют для отказа от решения, передачи объекта эксперту и выявления режимов, слабо поддержанных обучающими данными. Однако высокая неопределённость не является готовым детектором объектов вне распределения, а низкая — доказательством принадлежности обучающему распределению.

Активное обучение

В активном обучении система выбирает объекты, разметка которых ожидаемо наиболее полезна. Для этого применяют показатели эпистемической неопределённости или ожидаемого изменения апостериорного распределения. Простая отправка на разметку всех объектов с максимальной энтропией может преимущественно выбирать неразрешимый шум, поэтому функция приобретения должна соответствовать цели обучения.

Решения с возможностью отказа

В задачах с высокой ценой ошибки неопределённость может служить одним из сигналов для передачи решения человеку, дополнительного измерения или перехода в безопасный режим. Для этого заранее задают стоимость ошибок и отказов, проверяют пороги на отложенных данных и определяют действия после сигнала. Число, названное «неопределённостью», само по себе не делает систему безопасной.

Ограничения

Байесовская нейронная сеть не гарантирует правильной уверенности автоматически.

  • Апостериорное распределение почти всегда заменяется приближением, качество которого трудно проверить в большой модели.
  • Среднеполевой вариационный вывод не отражает корреляции и несколько мод и может недооценивать неопределённость.
  • Априор и правдоподобие влияют на прогноз, особенно при малом объёме данных и вне обучающей области.
  • Разные параметризации одной функции могут порождать сложные симметрии в пространстве весов.
  • Несколько выборок увеличивают стоимость обучения или вывода; малое число выборок добавляет ошибку Монте-Карло.
  • Хорошая калибровка на исходном тестовом распределении не гарантирует калибровку после сдвига данных.
  • Эпистемическая и алеаторическая неопределённости не всегда однозначно разделимы при неверно специфицированной модели.
  • Неопределённость не заменяет контроль качества данных, причинный анализ и содержательную проверку решения.

Если важный фактор отсутствует среди признаков, правила сбора данных систематически искажены или реальный процесс не входит в класс модели, формально последовательный вывод внутри BNN может оставаться неверным описанием мира.

Философский аспект

Байесовская нейронная сеть подчёркивает различие между утверждением «модель выдала ответ» и утверждением «для этого ответа достаточно оснований». Вместо одной оценки параметров рассматривается распределение гипотез, совместимых с данными и априорными предположениями.

Однако вероятностная форма не устраняет человеческий выбор. Разработчик задаёт пространство моделей, априор, правдоподобие, метод приближения и правило принятия решения. Поэтому численная неопределённость выражает степень уверенности внутри выбранной модели, а не универсальную меру незнания о реальном мире.

См. также

Литература

Личные инструменты