Дрейф данных

Материал из MachineLearning.

Перейти к: навигация, поиск
Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 18:20, 11 июля 2026 (MSD).

Промпты и описание редакторской проверки приведены в Обсуждение:Дрейф данных.


Содержание

Дрейф данных (англ. data drift) — изменение статистических свойств данных, поступающих в модель после её обучения и внедрения. В эксплуатационной практике этим выражением нередко называют широкий класс изменений распределения (distribution shift), хотя в более узком смысле data drift означает изменение распределения входных признаков P(X). Изменение зависимости целевой переменной от признаков P(Y\mid X) обычно называют дрейфом концепта (concept drift).

Дрейф важен для рекомендательных систем, кредитного скоринга, обнаружения мошенничества, медицинской диагностики и промышленного мониторинга. Модель может оставаться неизменной, но работать хуже, если изменились пользователи, бизнес-процесс, оборудование или способ получения признаков. Вместе с тем обнаруженное различие распределений ещё не доказывает деградацию качества и не является автоматическим основанием для переобучения.

Постановка задачи

Пусть при обучении совместное распределение признаков X и целевой переменной Y имело вид

P_{\mathrm{train}}(X,Y),

а в момент эксплуатации t оно равно

P_t(X,Y).

Распределительный сдвиг имеет место, если

P_t(X,Y)\ne P_{\mathrm{train}}(X,Y).

Совместное распределение можно разложить двумя способами:

P(X,Y)=P(Y\mid X)P(X)=P(X\mid Y)P(Y).

Эти разложения позволяют формально различить несколько идеализированных случаев. В реальной системе могут одновременно изменяться несколько множителей, поэтому однозначно отнести наблюдаемое изменение к одному типу удаётся не всегда.[1]

Важно разделять три наблюдения:

  • изменение распределения входов P(X);
  • изменение распределения предсказаний модели;
  • изменение качества предсказаний относительно истинных ответов.

Ни одно из них в общем случае не следует автоматически из другого.

Типы распределительного сдвига

Ковариатный сдвиг

Ковариатный сдвиг (covariate shift) — случай, когда распределение признаков изменилось,

P_t(X)\ne P_{\mathrm{train}}(X),

но условное распределение цели при фиксированных признаках осталось прежним:

P_t(Y\mid X)=P_{\mathrm{train}}(Y\mid X).

Например, после запуска продукта в новом регионе может измениться состав пользователей, хотя связь между наблюдаемыми характеристиками пользователя и целевым действием внутри каждой области признакового пространства сохраняется.

При выполнении этого предположения риск на новом распределении можно оценивать с помощью весов важности

w(x)=\frac{p_t(x)}{p_{\mathrm{train}}(x)}.

Такое взвешивание требует, чтобы области, существенные для нового распределения, были достаточно представлены в обучающих данных. Если p_{\mathrm{train}}(x) близка к нулю там, где p_t(x) велика, оценка отношения плотностей становится неустойчивой, а недостающую информацию невозможно получить одним перевзвешиванием.

Заметный ковариатный сдвиг может почти не влиять на качество, если изменились неиспользуемые или малоинформативные признаки. И наоборот, отсутствие заметного изменения в отдельных маргинальных распределениях не исключает изменения совместной структуры признаков или зависимости P(Y\mid X).

Сдвиг априорных вероятностей классов

Сдвиг априорных вероятностей классов (label shift, prior probability shift) задаётся условиями

P_t(Y)\ne P_{\mathrm{train}}(Y),
P_t(X\mid Y)=P_{\mathrm{train}}(X\mid Y).

Например, доля мошеннических операций может измениться, тогда как распределения признаков внутри классов «мошенничество» и «обычная операция» остаются прежними. В этом случае обычно меняются и P(X), и апостериорные вероятности P(Y\mid X); поэтому label shift нельзя определять как неизменность P(Y\mid X).

При подтверждённых предпосылках можно оценить новые доли классов и скорректировать вероятности или порог решения. Простая перенастройка порога недостаточна, если изменилось также P(X\mid Y) или само содержательное значение классов.

Дрейф концепта

Дрейф концепта — изменение зависимости целевой переменной от признаков:

P_t(Y\mid X)\ne P_{\mathrm{train}}(Y\mid X).

Например, после изменения кредитной политики одинаковые наблюдаемые характеристики заёмщика могут соответствовать иному риску, а после модернизации оборудования прежние показания датчиков — иной вероятности неисправности. Распределение P(X) при этом может как измениться, так и остаться прежним.

Изменение P(Y\mid X) также называют real concept drift; распределение P(X) при нём может измениться или остаться прежним. Если P(X) стабильно, такой дрейф принципиально не обнаруживается только сравнением неразмеченных входных данных: для его подтверждения нужны целевые метки, надёжные косвенные сигналы или дополнительные предположения.

Как изменение развивается во времени

В литературе различают несколько форм изменения концепта:[1]

  • резкое изменение (abrupt drift) — один режим быстро сменяется другим;
  • постепенное изменение (gradual drift) — старый и новый режимы некоторое время встречаются одновременно, а вероятность нового растёт;
  • инкрементальное изменение (incremental drift) — концепт последовательно проходит через промежуточные состояния;
  • повторяющееся изменение (recurring drift) — ранее наблюдавшийся режим возвращается, например из-за сезонности.

Кратковременный выброс или единичная аномалия не обязательно являются дрейфом. Для резкого изменения может быть полезно быстро уменьшить влияние старых данных, тогда как при повторяющихся режимах полное забывание истории способно ухудшить модель.

Причины

Изменение данных может отражать реальный процесс:

  • изменение поведения пользователей, рынка или состава аудитории;
  • появление новых товаров, устройств, категорий или каналов взаимодействия;
  • изменение правил принятия решений, законодательства или внешней среды;
  • старение или замена оборудования;
  • влияние решений самой модели на будущие наблюдения.

Похожий статистический сигнал возникает и при технической неисправности:

  • изменилась схема таблицы, единица измерения или кодировка категории;
  • нарушился порядок вычисления признаков;
  • выросла доля пропусков или дубликатов;
  • при обучении и эксплуатации используются разные версии преобразований;
  • метки стали поступать с ошибкой или по изменившемуся правилу.

Во втором случае переобучение на повреждённых данных не адаптирует систему, а закрепляет ошибку. Поэтому проверка конвейера должна предшествовать содержательной интерпретации дрейфа.

Мониторинг

Качество и схема данных

Сначала контролируют свойства, нарушение которых само по себе является ошибкой: типы и диапазоны значений, обязательные поля, уникальность ключей, долю пропусков, свежесть данных, версии справочников и преобразований. Такие проверки не заменяют статистический мониторинг, но позволяют быстрее отделить неисправность от естественного изменения среды.

Входные признаки

Для числовых признаков сравнивают квантили, гистограммы и долю пропусков; для категориальных — частоты, новые и исчезнувшие значения. Применяют двухвыборочные статистические критерии и расстояния между распределениями. Полезно оценивать не только отдельные признаки, но и их совместную структуру: стабильные маргинальные распределения могут скрывать изменение зависимостей между признаками.

Порог сигнала должен учитывать размер выборки и практическую значимость. На большом потоке статистический тест способен обнаружить очень малое различие, не влияющее на решения модели. При одновременной проверке множества признаков растёт число ложных тревог. Кроме того, эталонное окно должно учитывать известную сезонность и изменения объёма трафика.

Предсказания

Без меток можно отслеживать распределение прогнозов

P_t(\hat Y),

доли решений выше порога, неопределённость модели и выход объектов за область, представленную при обучении. Эти показатели дают ранний сигнал, но не измеряют точность. Распределение предсказаний может измениться при полностью корректной модели из-за label shift; оно может и остаться прежним, хотя ошибки перераспределились между объектами.

Качество по поступившим меткам

Когда истинные ответы доступны, отслеживают целевую функцию потерь, метрики классификации или регрессии, калибровку и бизнес-показатели. Для последовательности ошибок e_i можно вычислять среднее на недавнем окне W_t:

\bar e_t=\frac{1}{|W_t|}\sum_{i\in W_t}e_i.

При задержке разметки метрики следует группировать по времени получения прогноза, а не только по времени появления метки. Необходимо учитывать зрелость исхода: неполные когорты, для которых положительные или отрицательные события ещё не успели проявиться, дают смещённую оценку.

Средняя метрика может скрывать деградацию в важной подгруппе. Поэтому качество проверяют по регионам, типам устройств, категориям объектов и другим заранее определённым сегментам, контролируя достаточность размера каждой выборки.

Методы обнаружения

Фиксированные окна

Простейшая схема сравнивает недавнее окно с эталонным периодом либо два соседних окна. Короткое окно быстрее реагирует, но даёт шумные оценки; длинное устойчивее, но обнаруживает изменение с задержкой. Размер окна и пороги следует выбирать на временно упорядоченных исторических данных, а не по тестовой выборке итоговой модели.

ADWIN

ADWIN (Adaptive Windowing) предназначен для последовательности ограниченных скалярных наблюдений, например ошибок классификатора или выбранной статистики. Алгоритм поддерживает окно переменной длины и проверяет возможные разбиения на старую и новую части. Если различие их средних превышает порог, связанный с допустимой вероятностью ложной тревоги, устаревшая часть отбрасывается.[1]

В стабильный период окно может расти и использовать больше наблюдений; после изменения оно сокращается. ADWIN не устанавливает причину сигнала и сам по себе не является универсальным детектором произвольного многомерного сдвига. Результат зависит от того, какая скалярная величина подана на вход, и от наличия задержки меток, если контролируется ошибка модели.

Адаптация модели

Сигнал детектора должен запускать диагностику, а не безусловное переобучение. После подтверждения изменения применяют одну или несколько стратегий.

Периодическое переобучение

Переобучение по расписанию предсказуемо с точки зрения эксплуатации и аудита. Однако оно расходует ресурсы в стабильные периоды и может опоздать после резкого изменения. Без проверки качества свежих данных расписание способно регулярно выпускать модель хуже предыдущей.

Скользящее окно

Обучение только на последних k наблюдениях быстро забывает устаревший режим. Цена этого — меньший эффективный объём выборки и потеря редких либо сезонных случаев. Размер окна задаёт компромисс между скоростью адаптации и дисперсией оценки.

Взвешивание по давности

Старые наблюдения можно не удалять, а постепенно уменьшать их вес, например

w_i=\lambda^{t-i},\qquad 0<\lambda<1.

Такое затухание даёт плавную адаптацию, но не гарантирует соответствия реальной скорости дрейфа. Параметр \lambda выбирают на прошлых временных периодах с имитацией доступности данных и меток.

Онлайн-обучение

Онлайн-алгоритм обновляется по мере поступления новых примеров и может быстро реагировать на изменение. Одновременно возрастают риски обучения на временной аномалии, повреждённых данных или обратной связи от собственных решений. Нужны ограничения на обновление, журналирование версий и возможность отката.

Ансамбли

Ансамбль может добавлять модели, обученные на свежих данных, уменьшать вес устаревших моделей и сохранять специалистов для повторяющихся режимов. Это повышает гибкость, но усложняет интерпретацию, калибровку и контроль вычислительной стоимости.

Выбор стратегии зависит от типа изменения. При чистом label shift иногда достаточно коррекции вероятностей и порога; при изменении P(Y\mid X) может потребоваться новое обучение, новые признаки или пересмотр постановки задачи.

Практический порядок действий

  1. До внедрения фиксируют версии данных и преобразований, эталонные распределения, целевые метрики и допустимые задержки меток.
  2. В эксплуатации отдельно контролируют схему данных, входные признаки, предсказания и качество по созревшим меткам.
  3. После сигнала определяют затронутые признаки, интервалы и подгруппы; проверяют журналы поставщиков данных и недавние изменения продукта.
  4. Исключают поломку конвейера, изменение единиц измерения, неполную когорту меток и ошибку расчёта метрики.
  5. Проверяют, связано ли наблюдаемое изменение с деградацией модели и имеет ли оно практическую величину.
  6. Кандидатную стратегию адаптации оценивают на последующих временных интервалах без перемешивания будущих наблюдений в прошлое.
  7. Новую модель сравнивают со старой по общей метрике, подгруппам, калибровке и эксплуатационным ограничениям; сохраняют возможность отката.

Если решения модели влияют на то, какие данные будут наблюдаться далее, мониторинг отражает одновременно изменение среды и изменение политики сбора. Например, рекомендательная система получает отклики преимущественно на показанные ею объекты. Такое замыкание обратной связи требует анализа процесса принятия решений, а не только сравнения таблиц.

Ограничения мониторинга

Детектор сдвига не доказывает его причину и не выбирает правильное действие. Мониторинг без разметки способен обнаружить изменения наблюдаемых входов и выходов, но не измеряет непосредственно ошибку и не гарантирует обнаружение изменения P(Y\mid X).

Отсутствие тревоги также не является доказательством стабильности: детектор может не видеть совместный сдвиг, редкую подгруппу или новый тип объекта. Напротив, тревога может быть вызвана ожидаемой сезонностью, маркетинговой кампанией либо безвредным изменением малоинформативного признака.

Адаптация создаёт собственные риски. Частое переобучение увеличивает вариативность системы, может усиливать исторические смещения и затрудняет аудит. Поэтому правила обнаружения, диагностики, выпуска и отката должны проектироваться как единый эксплуатационный процесс.

Связь с философией искусственного интеллекта

Дрейф показывает ограниченность представления модели о мире: закономерность, найденная в исторических данных, действует лишь при определённых условиях сбора и применения. Модель не знает автоматически, сохранились ли эти условия после внедрения.

Поэтому надёжность системы определяется не только качеством исходного обучения, но и способностью обнаруживать изменение области применимости, получать обратную связь и пересматривать решения. При этом сам сигнал дрейфа не заменяет содержательного объяснения того, что именно изменилось.

См. также

Литература

Личные инструменты