StatWin

Данные и ИИ

Качество данных: чек-лист перед анализом

Чек-лист качества данных перед анализом и обучением модели: пропуски, дубликаты, выбросы, репрезентативность, утечки — что проверить до старта.

⟳ 26.07.2026 ◔ 2 мин ✎ Игорь Стрельцов
Качество данных: чек-лист перед анализом

Коротко

  • Мусор на входе — мусор на выходе: качество данных решает исход анализа сильнее выбора модели.
  • Проверьте пять вещей: пропуски, дубликаты, выбросы, репрезентативность, утечки.
  • Отделяйте реальные выбросы (важны) от ошибок ввода (вредят) — это разные вещи.
  • Утечка данных — самая коварная: модель «жульничает», подсматривая ответ через лишний признак.

В анализе данных есть неромантичная правда: 80% работы — это чистка данных, и именно она решает исход. Самая умная модель на грязных данных даст грязный результат — «мусор на входе, мусор на выходе». Вот чек-лист из пяти проверок, который стоит пройти прежде, чем считать что-либо.

1. Полнота: пропуски

Найдите отсутствующие значения. Важно не только сколько их, но и почему они пропали:

  • случайны ли пропуски или системны (например, определённая группа не отвечала на вопрос)?
  • чем заполнять (средним, медианой, отдельной категорией) или что удалить?

Системные пропуски — это скрытое смещение: их нельзя просто заполнить средним, не исказив картину.

2. Дубликаты

Повторяющиеся записи искажают статистику и дают модели ложный вес отдельным примерам — она «переучивается» на задвоенных данных. Найдите и уберите точные и скрытые дубликаты (та же запись с мелкими отличиями).

3. Выбросы: реальные или ошибки

Ключевое различие, которое многие путают. Выброс бывает:

  • реальным экстремумом — крупная сделка, редкий отказ. Это ценная информация, удалять нельзя.
  • ошибкой ввода — возраст 200 лет, отрицательная цена. Это мусор, надо исправить или убрать.

Задача — не «удалить все выбросы», а отличить одно от другого. Здесь же вспомните про среднее и медиану: выбросы перекашивают среднее, и медиана надёжнее.

4. Репрезентативность

Покрывают ли данные все важные группы и ситуации — или только удобные? Нерепрезентативные данные дают предвзятую модель: она хорошо работает на том, что видела, и плохо — на недопредставленном.

5. Утечки данных (самое коварное)

Утечка — когда среди признаков есть тот, что косвенно содержит ответ или был бы недоступен в момент реального прогноза. Модель «жульничает»: показывает блестящий результат на тесте и проваливается в жизни.

Пример: предсказываем болезнь, а в данных есть признак «назначено лекарство от неё». Модель просто читает ответ. Утечка незаметна и обесценивает весь анализ — проверяйте каждый подозрительно «сильный» признак: не подсматривает ли он будущее.

Пройдите эти пять пунктов — и большинство провалов анализа отсеются ещё до расчётов. Это скучная работа, но именно она отделяет надёжный результат от красивого мусора. Связанная тема — что вообще такое датасет и как его правильно делить.

Вопросы и ответы

Что проверить в данных перед анализом?

Пять вещей: пропуски (сколько и почему отсутствуют значения), дубликаты (повторы искажают статистику), выбросы (реальные экстремумы или ошибки ввода), репрезентативность (покрыты ли все важные группы) и утечки (нет ли среди признаков скрытого ответа). Эта проверка спасает от большинства провалов анализа.

Что такое утечка данных и почему она опасна?

Утечка — когда среди признаков есть тот, что косвенно содержит ответ или был бы недоступен в реальный момент прогноза. Модель «жульничает», показывая блестящий результат на тесте и проваливаясь в реальности. Пример: предсказывать болезнь, случайно включив в данные признак «выписано лекарство от неё». Коварна тем, что незаметна.

Все ли выбросы нужно удалять?

Нет. Выброс может быть реальным важным событием (крупная сделка, редкий отказ) — удалять его значит терять информацию. А может быть ошибкой ввода (возраст 200 лет) — тогда убрать. Задача не «удалить все выбросы», а отличить реальные экстремумы от ошибок и обойтись с каждым по-своему.

Источники и что почитать

  • Этапы подготовки данных (data cleaning) и понятие data leakage — стандартная практика анализа данных.