Все материалы
Продуктовая аналитикагайдстарт

Дисперсия и стандартное отклонение: как измерять разброс в данных

Понятное объяснение дисперсии и стандартного отклонения для аналитика: как читать разброс, сравнивать сегменты и не путать вариативность с ошибкой данных.

КПКейсПрактика18 июля 2026 г.9 мин

Две команды могут показать одинаковое среднее время ответа — 400 мс, но одна система будет стабильной, а другая иногда отвечать за 5 секунд. Если смотреть только на центр, проблема спрячется. Разброс помогает увидеть предсказуемость процесса и понять, сколько пользователей сталкивается с отклонением. Центральный вопрос материала: Почему одинаковое среднее не означает одинаковый пользовательский опыт?

Когда нужен этот метод

Две команды могут показать одинаковое среднее время ответа — 400 мс, но одна система будет стабильной, а другая иногда отвечать за 5 секунд. Если смотреть только на центр, проблема спрячется. Разброс помогает увидеть предсказуемость процесса и понять, сколько пользователей сталкивается с отклонением.

Разброс особенно полезен операционным командам. Он отвечает не только на вопрос «какой средний результат», но и «насколько часто процесс выходит за предел». Для latency это может стать SLO, для времени доставки — долей заказов позже обещания, для расходов — диапазоном, который нужен финансовому планированию.

разброс — часть сигнала

Почему одинаковое среднее не означает одинаковый пользовательский опыт?

Определения без жаргона

Дисперсия усредняет квадрат отклонения наблюдений от среднего. Стандартное отклонение возвращает показатель в исходные единицы и потому удобнее для разговора с командой. Это не «оценка качества» сама по себе: большой разброс может быть нормальным для платежей и тревожным для latency.

Выбери, считаешь ли ты разброс всей популяции или оценку по выборке. Для выборки в формуле используется поправка n−1, потому что среднее уже оценено по этим данным. В рабочих отчётах важнее не механически выбрать вариант, а явно назвать объект, окно и единицы: секунды, рубли, проценты или количество событий.

Стандартное отклонение выборки
s = √(Σ(xᵢ − x̄)² / (n − 1))

Квадрат нужен, чтобы отрицательные и положительные отклонения не уничтожали друг друга.

Рабочий кейс

У двух каналов одинаковый средний доход на пользователя — 900 ₽. У органики стандартное отклонение 220 ₽, у партнёрского канала — 1 140 ₽. Среднее скрывает риск: партнёрский канал может приводить небольшой слой дорогих клиентов и много пользователей без оплаты. Сравнивать каналы только по ARPU в такой ситуации опасно.

Посмотри на среднее вместе со стандартным отклонением, межквартильным размахом и квантилями. Если распределение сильно скошено, std не всегда хорошо описывает хвост — добавь median и p90. Для сравнения сегментов используй одинаковое окно, одинаковую единицу наблюдения и одинаковое правило обработки пропусков.

Одинаковое среднее, разный разброс

Условный пример ARPU по сегментам: среднее одинаковое, хвосты различаются.

Среднее ARPU, ₽

Контрольная сверка

До интерпретации проверь единицу наблюдения, период и правило включения. Затем пересчитай результат на небольшой выборке, где ответ известен заранее, и сравни с разумной альтернативой: другим горизонтом, зрелой когортой или user-level агрегацией.

Если показатель станет регулярным, сохрани рядом входные параметры, контрольные сверки и версию определения. Это важнее дополнительного знака после запятой.

Чем дополнить среднее
ПоказательЧто показываетКогда нужен
stdтипичный разброс вокруг среднегопримерно симметричное распределение
IQRширину центральных 50%скошенные данные и выбросы
p90верхний край массового опытаlatency, доставка, время ответа
nразмер группыпроверка устойчивости оценки
  • Зафиксируй baseline до просмотра результата.
  • Проверь пропуски, дубли и зрелость периода.
  • Покажи размер выборки и диапазон неопределённости.

Когда метод подводит

Стандартное отклонение не равно стандартной ошибке и не показывает неопределённость среднего. Нельзя складывать std разных метрик без приведения масштаба. Высокий разброс может возникнуть из-за разных сегментов, смешанных сценариев, дублей или настоящего разнообразия поведения. Перед тем как «чистить» хвост, проверь, не является ли он важным бизнес-сценарием.

Пиши не «разброс вырос, данные плохие», а «среднее осталось стабильным, но p90 и std выросли среди новых клиентов; значит, типичный сценарий не изменился, а редкие долгие случаи стали чаще». Дальше можно проверять конкретный шаг воронки, устройство, тариф или тип операции.

Факт → ограничение → действие

Сначала сообщи, что видно в данных. Затем назови, что мешает сделать более сильный вывод. В конце предложи один проверяемый следующий шаг.

Попробуй сам

Для одной метрики собери таблицу по сегментам: n, mean, median, std, p25, p75, p90. Затем поставь ограничение на минимальный размер сегмента. Маленькая группа с большим std может быть полезным сигналом, но не основанием для точного ранжирования без дополнительного наблюдения.

  • Сохрани период и параметры расчёта.
  • Назови хотя бы один крайний случай.
  • Сформулируй вывод отдельно от гипотезы о причине.

Что делать дальше

Пиши не «разброс вырос, данные плохие», а «среднее осталось стабильным, но p90 и std выросли среди новых клиентов; значит, типичный сценарий не изменился, а редкие долгие случаи стали чаще». Дальше можно проверять конкретный шаг воронки, устройство, тариф или тип операции.

Разброс особенно полезен операционным командам. Он отвечает не только на вопрос «какой средний результат», но и «насколько часто процесс выходит за предел». Для latency это может стать SLO, для времени доставки — долей заказов позже обещания, для расходов — диапазоном, который нужен финансовому планированию.

Продолжить чтение
Вся библиотека