Предварительный анализ данных

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Новая: {{UnderConstruction|Alfina Iamaeva 21:44, 14 июля 2026 (MSD)}})
Строка 1: Строка 1:
-
{{UnderConstruction|[[Участник:Alfina Iamaeva|Alfina Iamaeva]] 21:44, 14 июля 2026 (MSD)}}
+
{{DISPLAYTITLE:Предварительный анализ данных}}
 +
 
 +
'''Предварительный анализ данных''' ({{lang-en|Exploratory Data Analysis, '''EDA'''}}) — это подход, философия и набор методов анализа данных, целью которых является максимальное проникновение в суть данных, выявление их внутренней структуры, обнаружение аномалий, проверка исходных предположений и формулировка гипотез, прежде чем переходить к формальному моделированию или подтверждающему анализу . В отличие от [[Статистическая проверка гипотез|подтверждающего анализа]], EDA не проверяет заранее заданные гипотезы, а помогает ''обнаруживать'' их, позволяя данным «говорить самим за себя» .
 +
 
 +
== Философия и история ==
 +
 
 +
Термин «Exploratory Data Analysis» был введён выдающимся американским статистиком '''[[Джон Тьюки|Джоном Уайлдером Тьюки]]''' (John W. Tukey) в его знаковой книге «Exploratory Data Analysis», опубликованной в 1977 году . Тьюки позиционировал EDA не как простой набор инструментов, а как ''подход'' или ''философию'' анализа данных, которая откладывает в сторону жёсткие допущения о модели данных и отдаёт предпочтение прямому исследованию, позволяя данным самим раскрывать свою структуру . По его мнению, наибольшая ценность визуализации — в её способности «заставить нас заметить то, чего мы никогда не ожидали увидеть» . Идеи Тьюки в значительной степени опирались на опыт его наставника, Чарльза П. Уинзора (Charles P. Winsor), который учил его многим практическим аспектам работы с данными, «которых нет в книгах» .
 +
 
 +
== Цель и место в процессе анализа данных ==
 +
 
 +
Главная цель EDA — '''изучить''' данные, а не '''очистить''' их. Это критически важное различие. Сама по себе EDA не решает проблемы пропусков или выбросов, но помогает их '''обнаружить''' и понять их природу. Решения о том, как обрабатывать эти проблемы (например, [[Импутация данных|импутация]] пропусков, [[Винсоризация|винсоризация]] выбросов), принимаются на последующем этапе '''[[Предобработка данных|предобработки данных]]''' на основе инсайтов, полученных в ходе EDA. Принцип «[[Garbage In, Garbage Out]]» (GIGO) подчёркивает, что качество любого последующего [[Машинное обучение|машинного обучения]] или статистического вывода критически зависит от глубины понимания данных, достигнутой на этапе EDA. EDA даёт ответы на вопросы, которые определяют стратегию предобработки: нужно ли [[Масштабирование признаков|масштабировать]] данные и какой метод выбрать, как [[Кодирование категориальных переменных|кодировать]] категориальные признаки и какие [[Статистический тест|статистические тесты]] будут корректны.
 +
 
 +
== Основные задачи и принципы ==
 +
 
 +
В ходе предварительного анализа решаются следующие ключевые задачи :
 +
 
 +
* '''Обнаружение проблем''' (пропуски, [[Выброс (статистика)|выбросы]], нереалистичные значения, ошибки ввода).
 +
* '''Понимание структуры''' (распределение переменных, взаимосвязи и [[Корреляция|корреляции]], наличие кластеров или групп).
 +
* '''Проверка предположений''' (например, о нормальности распределения, гомоскедастичности, линейности связей), необходимых для многих статистических методов.
 +
* '''Формулировка гипотез''' о скрытых закономерностях, которые впоследствии могут быть проверены на новых данных.
 +
 
 +
Ключевой принцип EDA — максимальное использование возможностей человеческого восприятия, поэтому основным инструментом здесь является [[Статистическая визуализация|статистическая графика]].
 +
 
 +
== Стратегии и методы ==
 +
 
 +
EDA опирается на комбинацию графических и количественных методов .
 +
 
 +
=== Графические методы ===
 +
 
 +
Большинство методов EDA являются графическими, поскольку позволяют увидеть структуру данных целиком и обнаружить неожиданные паттерны .
 +
 
 +
* '''Анализ распределения одной переменной (унивариатный анализ):'''
 +
* '''[[Гистограмма]]''' — для оценки формы распределения (симметричность, «тяжёлые хвосты», мультимодальность).
 +
* '''[[Боксплот|Ящик с усами]] (box plot)''' — для визуализации медианы, квартилей и обнаружения выбросов.
 +
* '''[[Стебель-и-листья|Диаграмма «стебель-и-листья»]] (stem-and-leaf plot)''' — гибрид таблицы и гистограммы, позволяющий видеть и распределение, и отдельные значения .
 +
 
 +
* '''Анализ взаимосвязей между переменными (мультивариатный анализ):'''
 +
* '''[[Диаграмма рассеяния]] (scatter plot)''' — основной инструмент для визуализации связи между двумя [[Шкалы измерений|количественными переменными]]. Позволяет увидеть форму связи (линейную, нелинейную) и корреляцию.
 +
* '''Матрица диаграмм рассеяния (scatterplot matrix)''' — позволяет быстро оценить попарные связи для многих переменных.
 +
* '''[[Мозаичный график]] (mosaic plot)''' — для визуализации связи между двумя или более категориальными переменными.
 +
 
 +
=== Количественные методы ===
 +
 
 +
Визуализация часто дополняется расчётом простых статистик .
 +
 
 +
* '''[[Описательная статистика|Описательные статистики]]:'''
 +
* Меры центральной тенденции: [[Среднее арифметическое|среднее]], [[Медиана (статистика)|медиана]], [[Мода (статистика)|мода]].
 +
* Меры разброса (вариации): [[Дисперсия]], [[Стандартное отклонение]], межквартильный размах (IQR), размах (минимум и максимум).
 +
* Меры формы распределения: [[Асимметрия]] (skewness) и [[Эксцесс]] (kurtosis) .
 +
* '''Меры взаимосвязи:'''
 +
* [[Коэффициент корреляции Пирсона]] — для оценки силы линейной связи между количественными переменными .
 +
* [[Ранговая корреляция|Ранговые коэффициенты корреляции]] (например, [[Коэффициент корреляции Спирмена|Спирмена]]) — для порядковых переменных или в случае нарушения предположений о нормальности.
 +
 
 +
Важно помнить, что [[Корреляция не равна причинно-следственной связи]]. EDA помогает обнаружить корреляции, но интерпретировать их как причинно-следственные можно только с привлечением предметных знаний и последующих экспериментов .
 +
 
 +
== Связь с шкалами измерений ==
 +
 
 +
Выбор конкретных методов EDA критически зависит от '''типа [[Шкалы измерений|шкалы измерений]]''' анализируемых переменных . Понимание этой связи — основа корректного анализа.
 +
 
 +
{| class="wikitable"
 +
|+ Связь методов EDA и шкал измерений
 +
|-
 +
! Тип шкалы !! Допустимые методы EDA !! Примеры
 +
|-
 +
| '''[[Номинальная шкала]]''' (категории без порядка) || Частотные таблицы, мода, мозаичные графики, столбчатые диаграммы. || Цвет, пол, страна.
 +
|-
 +
| '''[[Порядковая шкала]]''' (категории с порядком) || Медиана, квартили, процентили, ранговые корреляции, ящики с усами. || Уровень образования, баллы удовлетворённости (1-5).
 +
|-
 +
| '''[[Интервальная шкала]]''' (количественная, нет естественного нуля) || Среднее, стандартное отклонение, гистограммы, диаграммы рассеяния, корреляция Пирсона. || Температура в °C, год.
 +
|-
 +
| '''[[Шкала отношений]]''' (количественная, есть естественный нуль) || Среднее, стандартное отклонение, гистограммы, диаграммы рассеяния, коэффициент вариации. || Возраст, доход, рост, цена .
 +
|}
 +
 
 +
Например, вычисление среднего значения для номинальной переменной (например, «средний цвет»), как и построение гистограммы для неё, бессмысленно. Этот фундаментальный принцип является одним из первых, которые проверяются в ходе EDA.
 +
 
 +
== Влияние на дальнейшие этапы ==
 +
 
 +
Результаты EDA напрямую определяют выбор методов [[Предобработка данных|предобработки данных]] и моделирования:
 +
 
 +
* '''Обнаружение сильной асимметрии''' указывает на необходимость применения [[Преобразование данных|преобразований]] (например, логарифмического) перед использованием методов, чувствительных к нормальности .
 +
* '''Выявление категориальных признаков''' с большим числом уникальных значений (высокая [[Кардинальность (SQL)|кардинальность]]) требует специальных стратегий [[Кодирование категориальных переменных|кодирования]].
 +
* '''Анализ диапазонов значений''' показывает, необходимо ли [[Масштабирование признаков|масштабирование]] признаков для алгоритмов, использующих метрики расстояния (например, [[Метод k-ближайших соседей|k-ближайших соседей]], [[Метод опорных векторов|SVM]]).
 +
* '''Обнаружение мультиколлинеарности''' (сильной корреляции между признаками) диктует необходимость [[Отбор признаков|отбора признаков]] или использования регуляризованных моделей.
 +
 
 +
== См. также ==
 +
 
 +
* [[Статистический анализ данных]]
 +
* [[Визуализация данных]]
 +
* [[Очистка данных]]
 +
* [[Конфирматорный анализ данных]]
 +
* [[Разведочный анализ данных]]

Версия 12:03, 19 июля 2026


Предварительный анализ данных (Шаблон:Lang-en) — это подход, философия и набор методов анализа данных, целью которых является максимальное проникновение в суть данных, выявление их внутренней структуры, обнаружение аномалий, проверка исходных предположений и формулировка гипотез, прежде чем переходить к формальному моделированию или подтверждающему анализу . В отличие от подтверждающего анализа, EDA не проверяет заранее заданные гипотезы, а помогает обнаруживать их, позволяя данным «говорить самим за себя» .

Содержание

Философия и история

Термин «Exploratory Data Analysis» был введён выдающимся американским статистиком Джоном Уайлдером Тьюки (John W. Tukey) в его знаковой книге «Exploratory Data Analysis», опубликованной в 1977 году . Тьюки позиционировал EDA не как простой набор инструментов, а как подход или философию анализа данных, которая откладывает в сторону жёсткие допущения о модели данных и отдаёт предпочтение прямому исследованию, позволяя данным самим раскрывать свою структуру . По его мнению, наибольшая ценность визуализации — в её способности «заставить нас заметить то, чего мы никогда не ожидали увидеть» . Идеи Тьюки в значительной степени опирались на опыт его наставника, Чарльза П. Уинзора (Charles P. Winsor), который учил его многим практическим аспектам работы с данными, «которых нет в книгах» .

Цель и место в процессе анализа данных

Главная цель EDA — изучить данные, а не очистить их. Это критически важное различие. Сама по себе EDA не решает проблемы пропусков или выбросов, но помогает их обнаружить и понять их природу. Решения о том, как обрабатывать эти проблемы (например, импутация пропусков, винсоризация выбросов), принимаются на последующем этапе предобработки данных на основе инсайтов, полученных в ходе EDA. Принцип «Garbage In, Garbage Out» (GIGO) подчёркивает, что качество любого последующего машинного обучения или статистического вывода критически зависит от глубины понимания данных, достигнутой на этапе EDA. EDA даёт ответы на вопросы, которые определяют стратегию предобработки: нужно ли масштабировать данные и какой метод выбрать, как кодировать категориальные признаки и какие статистические тесты будут корректны.

Основные задачи и принципы

В ходе предварительного анализа решаются следующие ключевые задачи :

  • Обнаружение проблем (пропуски, выбросы, нереалистичные значения, ошибки ввода).
  • Понимание структуры (распределение переменных, взаимосвязи и корреляции, наличие кластеров или групп).
  • Проверка предположений (например, о нормальности распределения, гомоскедастичности, линейности связей), необходимых для многих статистических методов.
  • Формулировка гипотез о скрытых закономерностях, которые впоследствии могут быть проверены на новых данных.

Ключевой принцип EDA — максимальное использование возможностей человеческого восприятия, поэтому основным инструментом здесь является статистическая графика.

Стратегии и методы

EDA опирается на комбинацию графических и количественных методов .

Графические методы

Большинство методов EDA являются графическими, поскольку позволяют увидеть структуру данных целиком и обнаружить неожиданные паттерны .

  • Анализ распределения одной переменной (унивариатный анализ):
   *   Гистограмма — для оценки формы распределения (симметричность, «тяжёлые хвосты», мультимодальность).
   *   Ящик с усами (box plot) — для визуализации медианы, квартилей и обнаружения выбросов.
   *   Диаграмма «стебель-и-листья» (stem-and-leaf plot) — гибрид таблицы и гистограммы, позволяющий видеть и распределение, и отдельные значения .
  • Анализ взаимосвязей между переменными (мультивариатный анализ):
   *   Диаграмма рассеяния (scatter plot) — основной инструмент для визуализации связи между двумя количественными переменными. Позволяет увидеть форму связи (линейную, нелинейную) и корреляцию.
   *   Матрица диаграмм рассеяния (scatterplot matrix) — позволяет быстро оценить попарные связи для многих переменных.
   *   Мозаичный график (mosaic plot) — для визуализации связи между двумя или более категориальными переменными.

Количественные методы

Визуализация часто дополняется расчётом простых статистик .

   *   Меры центральной тенденции: среднее, медиана, мода.
   *   Меры разброса (вариации): Дисперсия, Стандартное отклонение, межквартильный размах (IQR), размах (минимум и максимум).
   *   Меры формы распределения: Асимметрия (skewness) и Эксцесс (kurtosis) .
  • Меры взаимосвязи:
   *   Коэффициент корреляции Пирсона — для оценки силы линейной связи между количественными переменными .
   *   Ранговые коэффициенты корреляции (например, Спирмена) — для порядковых переменных или в случае нарушения предположений о нормальности.

Важно помнить, что Корреляция не равна причинно-следственной связи. EDA помогает обнаружить корреляции, но интерпретировать их как причинно-следственные можно только с привлечением предметных знаний и последующих экспериментов .

Связь с шкалами измерений

Выбор конкретных методов EDA критически зависит от типа шкалы измерений анализируемых переменных . Понимание этой связи — основа корректного анализа.

Связь методов EDA и шкал измерений
Тип шкалы Допустимые методы EDA Примеры
Номинальная шкала (категории без порядка) Частотные таблицы, мода, мозаичные графики, столбчатые диаграммы. Цвет, пол, страна.
Порядковая шкала (категории с порядком) Медиана, квартили, процентили, ранговые корреляции, ящики с усами. Уровень образования, баллы удовлетворённости (1-5).
Интервальная шкала (количественная, нет естественного нуля) Среднее, стандартное отклонение, гистограммы, диаграммы рассеяния, корреляция Пирсона. Температура в °C, год.
Шкала отношений (количественная, есть естественный нуль) Среднее, стандартное отклонение, гистограммы, диаграммы рассеяния, коэффициент вариации. Возраст, доход, рост, цена .

Например, вычисление среднего значения для номинальной переменной (например, «средний цвет»), как и построение гистограммы для неё, бессмысленно. Этот фундаментальный принцип является одним из первых, которые проверяются в ходе EDA.

Влияние на дальнейшие этапы

Результаты EDA напрямую определяют выбор методов предобработки данных и моделирования:

  • Обнаружение сильной асимметрии указывает на необходимость применения преобразований (например, логарифмического) перед использованием методов, чувствительных к нормальности .
  • Выявление категориальных признаков с большим числом уникальных значений (высокая кардинальность) требует специальных стратегий кодирования.
  • Анализ диапазонов значений показывает, необходимо ли масштабирование признаков для алгоритмов, использующих метрики расстояния (например, k-ближайших соседей, SVM).
  • Обнаружение мультиколлинеарности (сильной корреляции между признаками) диктует необходимость отбора признаков или использования регуляризованных моделей.

См. также

Личные инструменты