Распределения данных: нормальное, скошенное и двугорбое на понятных примерах
Как читать форму распределения в аналитике: нормальное, скошенное, двугорбое и дискретное распределения, их связь со средним, медианой и выбором метода.
Содержание статьи
Перед расчётом многие сразу выбирают тест или агрегат. Но форма распределения уже подсказывает, что будет происходить: доход и время часто имеют длинный правый хвост, оценки удовлетворённости ограничены шкалой, а смесь новых и постоянных пользователей может дать два пика. Без этого контекста результат выглядит точным, но объясняется плохо. Центральный вопрос материала: Почему одна и та же формула ведёт себя по-разному на времени, деньгах и конверсиях?
Ситуация из отчёта
Перед расчётом многие сразу выбирают тест или агрегат. Но форма распределения уже подсказывает, что будет происходить: доход и время часто имеют длинный правый хвост, оценки удовлетворённости ограничены шкалой, а смесь новых и постоянных пользователей может дать два пика. Без этого контекста результат выглядит точным, но объясняется плохо.
Форма распределения помогает объяснять разницу между массовым опытом и редким сценарием. Для продукта это может быть разделение новых и returning пользователей, для бизнеса — малых и крупных клиентов, для инженерной команды — обычных и тяжёлых запросов. Такая декомпозиция часто является первым шагом к правильному решению.
Почему одна и та же формула ведёт себя по-разному на времени, деньгах и конверсиях?
Статистическая модель
Распределение описывает, как наблюдения разбросаны по значениям. Нормальная форма симметрична вокруг центра, скошенная имеет длинный хвост, двугорбая часто указывает на смесь двух процессов, а дискретная состоит из отдельных значений. Это не набор ярлыков: форма помогает выбрать график, устойчивую оценку и дальнейшую проверку.
Начни с гистограммы или плотности, но не доверяй автоматическому числу бинов. Добавь boxplot, квантили и разрез по ключевому сегменту. Для долей проверь границы 0–1, для времени — единицы и цензурирование, для событий — нули и повторные действия. Иногда «ненормальность» исчезает после правильного разделения популяции.
Разбор чисел
Время ответа службы поддержки имеет два пика: около 5 минут в рабочие часы и около 18 часов ночью. Среднее 4 часа не описывает ни один сценарий и мешает планировать смены. Два пика — повод разделить часы, тип обращения и уровень приоритета, а не искать магическую трансформацию.
Собери диагностический набор: n, минимум, p25, median, p75, p95, максимум, пропуски и число уникальных значений. Затем посмотри форму по датам и сегментам. Если распределение меняется после релиза, это может быть продуктовый сигнал или ошибка трекинга. Метод анализа выбирай после этого шага, а не до него.
Длинный хвост справа делает среднее выше медианы.
Что проверить в данных
До интерпретации проверь единицу наблюдения, период и правило включения. Затем пересчитай результат на небольшой выборке, где ответ известен заранее, и сравни с разумной альтернативой: другим горизонтом, зрелой когортой или user-level агрегацией.
Если показатель станет регулярным, сохрани рядом входные параметры, контрольные сверки и версию определения. Это важнее дополнительного знака после запятой.
| Форма | Что проверить | Первый шаг |
|---|---|---|
| Симметричная | центр и хвосты | mean + std или квантили |
| Скошенная | выбросы и длинный хвост | median + p90 |
| Два пика | смесь сегментов | разрез по сценарию |
| Дискретная | нули и частые значения | частоты и доли |
- Зафиксируй baseline до просмотра результата.
- Проверь пропуски, дубли и зрелость периода.
- Покажи размер выборки и диапазон неопределённости.
Границы вывода
Гистограмма может скрыть второй пик из-за слишком широких бинов. Boxplot не показывает форму внутри квартилей. Нормальность данных не является обязательным условием для каждого теста, а логарифмирование не делает вывод автоматически корректным. Самая опасная ошибка — спрятать разные процессы под одним средним.
Вместо «данные не нормальные» скажи, что именно увидел: «время до покупки скошено вправо, p90 в три раза выше медианы, хвост сформирован корпоративным каналом». Такой вывод ведёт к проверке сегмента и процессу. Он полезнее, чем спор о том, достаточно ли красив график.
Сначала сообщи, что видно в данных. Затем назови, что мешает сделать более сильный вывод. В конце предложи один проверяемый следующий шаг.
Самостоятельный расчёт
Для трёх своих метрик сделай по одному набору диагностик и подпиши форму словами. Для каждой ответь: какой центр устойчив, какой квантиль важен, какой сегмент может смешиваться с остальными и какой метод сравнения не стоит применять автоматически. Сохрани график рядом с числовой таблицей.
summary = df['time_to_value'].describe(percentiles=[.25, .5, .75, .9, .95])
summary
df['segment'].value_counts(dropna=False)- Сохрани период и параметры расчёта.
- Назови хотя бы один крайний случай.
- Сформулируй вывод отдельно от гипотезы о причине.
Как сообщить результат
Вместо «данные не нормальные» скажи, что именно увидел: «время до покупки скошено вправо, p90 в три раза выше медианы, хвост сформирован корпоративным каналом». Такой вывод ведёт к проверке сегмента и процессу. Он полезнее, чем спор о том, достаточно ли красив график.
Форма распределения помогает объяснять разницу между массовым опытом и редким сценарием. Для продукта это может быть разделение новых и returning пользователей, для бизнеса — малых и крупных клиентов, для инженерной команды — обычных и тяжёлых запросов. Такая декомпозиция часто является первым шагом к правильному решению.
Материалы по теме
Статистика для аналитика с нуля: как читать данные и не делать лишних выводов
Базовый маршрут по статистике для аналитика: выборка, распределение, среднее, медиана, интервал неопределённости и проверка гипотезы на рабочих примерах.
Среднее, медиана и мода: какую «середину» выбрать в аналитике
Разбираем среднее арифметическое, медиану и моду на примерах выручки, времени доставки и размера заказа: когда показатели расходятся и что писать в выводе.
Дисперсия и стандартное отклонение: как измерять разброс в данных
Понятное объяснение дисперсии и стандартного отклонения для аналитика: как читать разброс, сравнивать сегменты и не путать вариативность с ошибкой данных.