Пост-хок калибровка нейронных сетей

Материал из MachineLearning.

Перейти к: навигация, поиск
Статья написана с использованием LLM Qwen3.7-Max и проверена участником Arsen Temirov 23:36, 19 июля 2026 (MSD)

Промпт приводится полностью в Обсуждение:Пост-хок калибровка


Содержание

Введение

Пост-хок калибровка (от лат. post hoc — «после этого») — класс методов в машинном обучении, направленных на корректировку вероятностных выходов обученной модели таким образом, чтобы предсказанная уверенность соответствовала её фактической точности.

В отличие от методов, встроенных в процесс обучения (сглаживание меток, специализированные функции потерь), пост-хок методы применяются к уже обученной базовой модели. Они не требуют изменения архитектуры нейронной сети или повторного обучения на исходном наборе данных, а лишь обучают легковесную функцию отображения (калибратор) на отдельной валидационной выборке, используя нескорректированные выходы сети (логиты).

Проблема калибровки в глубоком обучении

Современные глубокие нейронные сети (ResNet, Vision Transformers, большие языковые модели) обладают огромной емкостью и способны достигать высочайшей точности (accuracy). Однако эти модели склонны к переобученности уверенностью (overconfidence).

Если модель предсказывает класс с вероятностью 99% (через функцию softmax), ожидается, что в 99 случаях из 100 её предсказание будет верным. На практике современные нейросети часто выдают экстремальные вероятности (близкие к 0 или 1) даже для объектов, в которых они «не уверены», а их фактическая точность для таких предсказаний может составлять лишь 70–80%.

Причины этого явления кроются в оптимизации: использование перекрестной энтропии (cross-entropy) в качестве функции потерь стимулирует сеть бесконечно увеличивать значения логитов для правильного класса, что приводит к насыщению softmax и потере адекватной градации уверенности. Пост-хок калибровка решает эту проблему, выступая в роли «нормализатора» выходов модели.

Математическая формулировка и метрики

Формальное определение

Пусть X — входные данные, Y \in \{1, \dots, K\} — истинные метки классов. Обученная нейронная сеть генерирует распределение вероятностей \hat{P} = (p_1, \dots, p_K), где p_k = P(Y=k \mid X). Предсказанный класс \hat{Y} и уверенность модели \hat{p} определяются как: \hat{Y} = \arg\max_k p_k, \quad \hat{p} = \max_k p_k

Модель называется идеально калиброванной, если её уверенность совпадает с вероятностью истинности предсказания для любого значения q \in [0, 1]: \mathbb{P}(\hat{Y} = Y \mid \hat{p} = q) = q, \quad \forall q \in [0, 1]

Диаграмма надежности (Reliability Diagram)

Для визуальной оценки калибровки используется диаграмма надежности. Ось абсцисс разбивается на M интервалов (бинов), например, [0, 0.1), [0.1, 0.2), \dots, [0.9, 1.0]. Для каждого бина вычисляется:

  1. Средняя уверенность (confidence) всех предсказаний, попавших в бин.
  2. Эмпирическая точность (accuracy) — доля верных предсказаний в этом бине.

Для идеально калиброванной модели столбцы гистограммы будут лежать строго на диагональной линии y = x. Отклонения от диагонали демонстрируют степень переобученности (столбцы ниже диагонали) или необоснованной неуверенности (столбцы выше диагонали) модели.

Ожидаемая ошибка калибровки (ECE)

Для количественной оценки используется метрика Expected Calibration Error (ECE), которая вычисляет взвешенное среднее разниц между точностью и уверенностью по всем бинам: \text{ECE} = \sum_{m=1}^{M} \frac{n_m}{N} \left| \text{acc}(B_m) - \text{conf}(B_m) \right| где:

  • M — количество бинов,
  • B_m — множество индексов примеров, попавших в m-й бин,
  • n_m = |B_m| — количество примеров в бине,
  • N — общее количество примеров,
  • \text{acc}(B_m) и \text{conf}(B_m) — средняя точность и средняя уверенность в бине B_m соответственно.

Чем ближе ECE к нулю, тем лучше калибрована модель.

Методы пост-хок калибровки

Пост-хок методы работают с логитами (ненормированными оценками до применения softmax) z = (z_1, \dots, z_K), предлагая различные способы их трансформации перед финальным преобразованием в вероятности.

Температурное шкалирование (Temperature Scaling)

Наиболее популярный и эффективный метод для многоклассовой классификации, являющийся обобщением шкалирования Платта. Метод вводит один скалярный параметр — «температуру» T > 0, на который делятся все логиты перед применением softmax: \hat{q}_i = \frac{\exp(z_i / T)}{\sum_{j=1}^{K} \exp(z_j / T)}

  • При T > 1 распределение вероятностей становится более «плавным» (энтропия растет), что снижает переобученность уверенностью.
  • При T < 1 распределение становится более «острым».

Параметр T оптимизируется путем минимизации отрицательного логарифмического правдоподобия (NLL) на отдельной калибровочной выборке. Благодаря наличию всего одного параметра, метод крайне устойчив к переобучению даже на малых выборках.

Шкалирование Платта (Platt Scaling)

Изначально разработанный для калибровки опорных векторов (SVM), метод отлично работает для бинарной классификации в нейронных сетях. На логит положительного класса z обучается модель логистической регрессии: P(Y=1 \mid z) = \frac{1}{1 + \exp(Az + B)} Параметры A и B подбираются на валидационной выборке. Для многоклассовой задачи метод требует обучения бинарных классификаторов по схеме «один против всех» (One-vs-Rest), что может нарушить условие нормировки вероятностей (\sum p_k = 1).

Биннинг гистограмм (Histogram Binning)

Непараметрический метод. Пространство уверенности [0, 1] разбивается на бины. Для каждого бина вычисляется эмпирическая доля верных ответов на калибровочной выборке. При инференсе, если исходная уверенность модели попадает в определенный бин, ей присваивается фиксированное значение вероятности, равное исторической точности этого бина. Метод прост, но страдает от разрывности функции и требует большого объема данных для адекватного заполнения бинов.

Изотоническая регрессия (Isotonic Regression)

Развитие идеи биннинга. Это непараметрический метод, который обучает кусочно-постоянную, но строго неубывающую (изотоническую) функцию, минимизирующую квадратичную ошибку между предсказаниями и истинными метками. Изотоническая регрессия решает проблему разрывности и гарантирует, что более высокая исходная уверенность сети всегда транслируется в более высокую калиброванную вероятность.

Векторное и матричное шкалирование

Обобщения температурного шкалирования.

  • Векторное шкалирование умножает каждый логит z_k на свой собственный параметр T_k.
  • Матричное шкалирование применяет полносвязный линейный слой к вектору логитов: z' = Wz + b.

Эти методы обладают большей емкостью, чем температурное шкалирование, и могут учитывать сложные корреляции между классами (например, путаницу между семантически близкими классами), однако требуют значительно больших калибровочных выборок для предотвращения переобучения.

Процесс обучения калибратора

Критически важным аспектом пост-хок калибровки является изоляция данных. Калибратор не должен обучаться на том же наборе данных, на котором обучалась базовая нейронная сеть, иначе он подстроится под шум и переобученность самой сети (data snooping).

Стандартный пайплайн включает три непересекающихся датасета:

  1. Train Set: используется для обучения весов нейронной сети.
  2. Calibration Set (Validation Set): используется для оптимизации параметров калибратора (например, температуры T).
  3. Test Set: используется для финальной оценки метрик (Accuracy, ECE) уже откалиброванной модели.

Практическое применение в ИИ

  1. Системы критической важности (Safety-Critical Systems): В медицинской диагностике и автономном вождении цена ошибки чрезвычайно высока. Откалиброванная модель позволяет системе понимать границы своей компетенции. Если калиброванная уверенность падает ниже заданного порога, система может передать принятие решения человеку-оператору (опция отклонения / rejection option).
  2. Обнаружение аномалий и OOD detection: Калиброванные вероятности часто служат лучшим индикатором для выявления объектов, не принадлежащих к обучающему распределению (Out-of-Distribution). Высокая энтропия на выходе калиброванной модели часто коррелирует с тем, что входные данные являются аномальными.
  3. Активное обучение (Active Learning): В задачах, где разметка данных стоит дорого, модели используются для отбора наиболее «информативных» примеров. Переобученные уверенностью сети плохо ранжируют неопределенность, тогда как калиброванные модели позволяют корректно применять стратегии сэмплирования, основанные на энтропии или margin sampling.
  4. Ансамблирование моделей: При усреднении предсказаний нескольких нейронных сетей использование калиброванных выходов дает более корректные апостериорные вероятности с точки зрения байесовского вывода.

Ограничения и современные вызовы

Несмотря на эффективность, пост-хок калибровка имеет фундаментальные ограничения:

  • Проблема сдвига распределения (Domain Shift): Методы, обученные на in-distribution (ID) данных, часто полностью теряют калибровку при применении к out-of-distribution (OOD) данным. Модель может стать еще более переобученной уверенностью на аномальных объектах.
  • Зависимость от размера выборки: Для сложных методов (матричное шкалирование, изотоническая регрессия) требуется большой объем размеченных данных для калибровки, что не всегда доступно в нишевых предметных областях.
  • Мультиклассовый дисбаланс: В задачах с сильным дисбалансом классов глобальные метрики (как ECE) могут маскировать плохую калибровку миноритарных классов. В таких случаях требуется применение классово-зависимых (class-conditional) методов калибровки.

Пост-хок калибровка остается стандартом де-факто в индустрии благодаря своей вычислительной дешевизне, простоте интеграции в уже работающие MLOps-пайплайны и способности значительно повысить доверие к выводам систем искусственного интеллекта.

См. также

Литература

  • Guo C., Pleiss G., Sun Y., Weinberger K. Q. On Calibration of Modern Neural Networks // Proceedings of the 34th International Conference on Machine Learning (ICML). — 2017. — Т. 70. — С. 1321-1330.
  • Niculescu-Mizil A., Caruana R. Predicting Good Probabilities with Supervised Learning // Proceedings of the 22nd International Conference on Machine Learning (ICML). — 2005. — С. 625-632.
  • Platt J. C. Probabilistic Outputs for Support Vector Machines and Comparisons to Regularized Likelihood Methods // Advances in Large Margin Classifiers. — 1999. — С. 61-74.
  • Zadrozny B., Elkan C. Transforming Classifier Scores into Accurate Multiclass Probability Estimates // Proceedings of the 8th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. — 2002. — С. 694-699.
  • Minderer M., Djolonga J., Romijnders R., Hubis F., Zhai X., Houlsby N., Tran D., Lucic M. Revisiting the Calibration of Modern Neural Networks // Advances in Neural Information Processing Systems (NeurIPS). — 2021. — Т. 34. — С. 15682-15694.
  • Kull M., Perello Nieto M., Kängsepp M., Silva Filho T., Song H., Flach P. Beyond Temperature Scaling: Obtaining Well-Calibrated Multi-Class Probabilities with Dirichlet Calibration // Advances in Neural Information Processing Systems (NeurIPS). — 2019. — Т. 32. — С. 12295-12305.
  • Kumar A., Sarawagi S., Jain U. Trainable Calibration Measures for Neural Networks from Kernel Mean Embeddings // Proceedings of the 35th International Conference on Machine Learning (ICML). — 2018. — Т. 80. — С. 2805-2814.
Личные инструменты