Представьте опрос на 20 вопросов, который заполнили тысяча человек. Часть респондентов пропустила вопрос о доходе, кто-то не указал возраст, а несколько анкет вообще оборвались на середине. Когда аналитик открывает таблицу, он видит не сплошные ряды чисел, а решето с пустыми ячейками. Именно эти пустоты в аналитике называют missing data — пропущенными данными, и от того, как с ними обращаться, зависит, можно ли доверять итоговым рейтингам, графикам и выводам.
- Что такое missing data простыми словами
- Откуда берутся пропуски: типичные причины
- Три типа пропусков: MCAR, MAR и MNAR
- MCAR — пропуски полностью случайные
- MAR — пропуски, которые объясняются другими переменными
- MNAR — пропуски, которые зависят от самого значения
- Как пропуски влияют на рейтинги и инфографику
- Основные методы обработки missing data
- Удаление
- Простая импутация
- Импутация на основе других переменных
- Алгоритмы, устойчивые к пропускам
- Документирование вместо «ремонта»
- Примеры missing data из практики
- Как проверить данные на пропуски: короткий алгоритм
- Часто задаваемые вопросы
- Можно ли просто заменить все пропуски нулями?
- Сколько пропусков считается критичным?
- Что лучше: удалить строки или заполнить пропуски?
- Нужно ли показывать пропуски на инфографике?
- Что стоит запомнить перед работой с данными
Что такое missing data простыми словами
Missing data — это ситуация, когда для определённого наблюдения нет значения в одном или нескольких полях набора данных. Простыми словами: в таблице есть место для ответа, но ответа там нет. В файле это может выглядеть как пустая ячейка, обозначение NA, NaN, null или технический код вроде «-99», которым раньше заменяли отсутствующие значения.

Важно отличать пропуск от нуля. Ноль — это конкретное значение («количество детей: 0»), а пропуск означает, что мы просто не знаем ответа. Путаница между этими двумя состояниями — одна из самых распространённых ошибок новичков, и она способна исказить любой расчёт. Если десять опрошенных не ответили на вопрос о сбережениях, а вы записали им нули, среднее по выборке искусственно просядет, и вся дальнейшая инфографика будет строиться на ложной основе.
Значение этого термина выходит далеко за пределы статистических учебников. Пропуски встречаются везде: в медицинских реестрах, где пациент не сдал один из анализов; в веб-аналитике, где скрипт не сработал на части сессий; в финансовой отчётности, где компания не раскрыла отдельный показатель. Поэтому вопрос «missing data что это и как с этим жить» встаёт перед журналистами, маркетологами, исследователями и всеми, кто готовит рейтинги или визуализации на основе реальных данных.
Откуда берутся пропуски: типичные причины
Прежде чем что-то делать с пропусками, нужно понять, почему они возникли. Причина пропуска — это не мелочь, а ключ к выбору правильного метода обработки. Самые частые источники пропущенных значений таковы:
- Человеческий фактор. Респондент отказался отвечать, устал от длинной анкеты, не понял вопрос или случайно его пропустил. Чувствительные темы — доход, здоровье, политические взгляды — пропускают заметно чаще, чем нейтральные.
- Технические сбои. Датчик временно отключился, сервер не записал часть событий, форма на сайте не передала поле из-за ошибки в коде. Такие пропуски обычно имеют чёткий временной или системный паттерн.
- Объединение источников. При сведении таблиц из разных систем одни колонки существуют в одном источнике, но отсутствуют в другом. Результат — целые блоки пустых ячеек после слияния.
- Конструкция исследования. Иногда вопрос просто не задавался части участников: например, разветвлённая анкета, где подгруппа ответов логически не нужна. Это запланированные пропуски, и обрабатывать их надо иначе, чем случайные.
- Потеря данных на этапе обработки. Повреждённый файл, неудачный экспорт, обрезание исторических записей — классические сценарии в реальных рабочих процессах.
Практический совет: перед любым анализом посчитайте долю пропусков в каждой колонке и посмотрите, нет ли в их распределении закономерности. Если 40% пропусков о доходе приходится на одну возрастную группу — это уже не случайность, а сигнал, который надо учитывать в методологии.
Три типа пропусков: MCAR, MAR и MNAR
В методологии данных принята классификация, которую предложили статистики Дональд Рубин и Родерик Литтл. Она делит пропуски на три типа в зависимости от механизма их возникновения, и именно эта классификация определяет, насколько опасны пропуски для выводов.

MCAR — пропуски полностью случайные
Missing Completely at Random означает, что факт пропуска не связан ни с чем: ни со значением самой переменной, ни с другими характеристиками. Классический пример — лаборантка случайно разлила несколько пробирок из общей партии. Потерянные данные не отличаются от сохранённых, поэтому анализ без них даёт несмещённые, хотя и менее точные результаты. На практике чистый MCAR встречается редко, но это самый безопасный сценарий.
MAR — пропуски, которые объясняются другими переменными
Missing at Random — ситуация, когда пропуск зависит от данных, которые мы знаем, но не от самого пропущенного значения. Пример: мужчины в опросе реже отвечают на вопрос о расходах на косметику. Пол мы знаем, поэтому можем смоделировать и компенсировать пропуск на основе других известных полей. Большинство статистических методов импутации рассчитаны именно на этот тип, и в реальных исследованиях MAR — самое распространённое рабочее предположение.
MNAR — пропуски, которые зависят от самого значения
Missing Not at Random — самый тяжёлый случай: пропуск связан с тем значением, которого мы не видим. Люди с очень высокими или очень низкими доходами чаще скрывают доход. Пациенты с более плохим состоянием чаще пропускают контрольные визиты. Здесь простая замена средним системно исказит результат, потому что отсутствующие значения принципиально отличаются от имеющихся. С MNAR работают через специальные модели, привлечение дополнительных данных или честное указание ограничения в выводах.
| Тип | От чего зависит пропуск | Насколько искажает анализ | Что обычно делают |
|---|---|---|---|
| MCAR | Ни от чего, чистый случай | Снижает точность, но не смещает | Удаление строк допустимо |
| MAR | От других известных переменных | Смещает при игнорировании, корректируется | Импутация на основе других полей |
| MNAR | От самого пропущенного значения | Сильное системное искажение | Специальные модели, анализ чувствительности |
Как пропуски влияют на рейтинги и инфографику
В проектах формата «рейтинги и инфографика» missing data — это не абстрактная проблема статистики, а прямая угроза достоверности публикации. Представьте рейтинг школ по среднему баллу тестов: если в части заведений результаты неполные, их позиции в таблице отражают не качество образования, а структуру пропусков. Школа, которая передала данные только за сильные классы, формально будет выглядеть лучше той, что предоставила полный массив. Поэтому в редакционных процессах важно заранее планировать, как данные, рейтинги и инфографика превращаются в понятные читателю материалы.

Вторая ловушка — визуальная. На графике пропуски либо исчезают, создавая ложное ощущение сплошного ряда, либо превращаются в нули, ломая масштаб. Линейный график с разрывами и тот же график, где пропуски «заштопаны» интерполяцией, рассказывают разные истории, хотя построены на одних данных. Поэтому главное правило визуализации звучит так: пропущенные данные должны быть видны как пропущенные, а не замаскированы под имеющиеся. Обозначьте разрывы, добавьте примечание о доле неполных записей, и читатель сможет сам оценить надёжность картинки.
Третий риск касается сравнений. Когда вы считаете среднее, медиану или долю по группам с разным уровнем полноты данных, простые формулы молча дают группам с пропусками неявную «поправку». Рейтинг стран по уровню счастья, корпоративный дашборд, медийный индекс доверия — все эти продукты чувствительны к тому, как авторы обработали missing data ещё до того, как сели рисовать диаграмму.
Основные методы обработки missing data
Универсального рецепта нет — выбор метода зависит от типа пропусков, их количества и задачи анализа. Но практический арсенал выглядит так.
Удаление
Самый простой путь — убрать строки или колонки с пропусками. Это оправдано, когда пропусков мало (ориентировочно до нескольких процентов), они типа MCAR, а выборка большая. Минус очевиден: мы выбрасываем полезную информацию из остальных полей удалённых строк и рискуем получить смещённую выборку, если пропуски не были случайными. Удалять колонку стоит, когда она пуста на значительную часть и не критична для выводов.
Простая импутация
Замена пропуска типичным значением: средним, медианой или модой. Медиана обычно лучше среднего для данных с выбросами — например, для доходов. Метод быстрый и понятный, но имеет недостатки: он искусственно уменьшает вариабельность данных и рвёт связи между переменными. Для черновой разведки это приемлемо, для финальных рейтингов — сомнительно.
Импутация на основе других переменных
Более сложные подходы прогнозируют пропущенное значение по остальным данным: регрессионная импутация, метод k ближайших соседей, множественная импутация (multiple imputation), где создают несколько версий заполненного набора и оценивают неопределённость. Эти методы корректнее при MAR, но требуют статистической грамотности и проверки предположений.
Алгоритмы, устойчивые к пропускам
Некоторые модели машинного обучения, в частности деревья решений и градиентный бустинг, умеют работать с пропусками напрямую, трактуя их как отдельное состояние. Иногда полезно создать дополнительную переменную-индикатор «было значение или нет» — сам факт пропуска может нести информацию, особенно при MNAR.
Документирование вместо «ремонта»
В журналистских и исследовательских проектах часто самый честный метод — не заполнять пропуски вообще, а прямо указать в методологии: сколько данных не хватает, где именно и как это влияет на выводы. Доверительное примечание в рейтинге ценнее иллюзии полноты.
Примеры missing data из практики
Несколько типичных сценариев помогут увидеть, как missing data работает в реальных задачах.
Сценарий первый: социологический опрос. Из 1200 респондентов 15% не указали доход. Анализ показывает, что среди них преобладают люди старшего возраста. Это MAR: пропуск связан с известной переменной — возрастом. Решение — импутация внутри возрастных групп или расчёт итоговых показателей с поправкой на структуру выборки, а не простое удаление 180 анкет.
Сценарий второй: метеостанция. Датчик влажности сломался на три дня во время грозы. Пропуски не связаны со значениями влажности — это близко к MCAR. Здесь допустима интерполяция между соседними днями, но на графике эти три точки стоит обозначить как восстановленные.
Сценарий третий: отзывы клиентов. Покупатели, которые остались недовольны, чаще не заполняют поле «порекомендуете ли вы нас друзьям». Пропуск зависит от скрытого ответа — классический MNAR. Если проанализировать только заполненные поля, лояльность клиентов окажется завышенной. Правильное решение — учесть сам факт молчания как сигнал и сообщить об этом в выводах.
Сценарий четвёртый: сводный рейтинг. Редакция строит рейтинг городов по качеству жизни, но два показателя из десяти отсутствуют для части городов. Механическое усреднение имеющихся показателей даёт городам с неполными данными нечестное преимущество или штраф. Методологически грамотный выход — взвешивание с учётом полноты данных или вынесение таких городов в отдельную категорию «недостаточно данных».
Как проверить данные на пропуски: короткий алгоритм
Приведённая ниже последовательность — универсальный минимум перед любым анализом, рейтингом или визуализацией:

- Посчитайте количество и процент пропусков в каждой переменной отдельно, а не только в целом по таблице.
- Постройте карту пропусков: визуально или таблично посмотрите, кластеризуются ли они по времени, группам или источникам данных.
- Проверьте гипотезу о механизме: отличаются ли записи с пропусками от полных по другим известным признакам.
- Убедитесь, что технические коды (ноль, «-99», «н/д») не маскируются под настоящие значения.
- Выбирайте метод обработки, исходя из типа пропусков и задачи, а не из удобства инструмента.
- Проведите анализ чувствительности: сравните результаты до и после обработки, чтобы понять, насколько выводы зависят от вашего решения.
- Зафиксируйте в методологии, сколько данных было пропущено и что вы с ними сделали.
Этот порядок действий занимает от получаса до одного рабочего дня в зависимости от набора данных, но именно он отделяет аналитику, которой можно доверять, от чисел, собранных наугад.
Часто задаваемые вопросы
Можно ли просто заменить все пропуски нулями?
Почти никогда. Ноль — это конкретное значение, а не отсутствие информации. Такая замена искажает средние, корреляции и рейтинги. Исключение — случаи, когда пропуск по логике данных действительно означает ноль, например отсутствие транзакции в учёте продаж.
Сколько пропусков считается критичным?
Универсального порога нет. Ориентир в несколько процентов случайных пропусков обычно некритичен, а при 20–30% нужны аргументированные методы обработки. Но важнее не количество, а структура: даже 5% пропусков типа MNAR способны разрушить выводы.
Что лучше: удалить строки или заполнить пропуски?
Удаление проще и безопаснее при малом количестве случайных пропусков. Импутация сохраняет объём данных и корректнее при системных пропусках, но требует проверки предположений. В ответственных публикациях часто комбинируют: анализируют оба варианта и сверяют результаты.
Нужно ли показывать пропуски на инфографике?
Да. Разрыв на графике или примечание о неполных данных — это не недостаток работы, а признак честной методологии. Скрытые пропуски создают у читателя ложную уверенность в точности картинки.
Что стоит запомнить перед работой с данными
Missing data — это не техническая мелочь, а часть самих данных: пропуски почти всегда что-то означают. Ключевой тезис, который стоит держать в голове: сначала выясните, почему данных нет, и только потом решайте, что с ними делать. Удаление, импутация или честное документирование — всё это рабочие инструменты, но они работают лишь тогда, когда выбраны осознанно, с пониманием механизма пропусков. А для всех, кто готовит рейтинги и инфографику, есть ещё одно простое правило: читатель имеет право знать, насколько полной была картина до того, как её превратили в красивую диаграмму.












