Все материалы
Продуктовая аналитикагайдстарт

Effect size: как оценивать практическую значимость результата

Что такое размер эффекта и почему он важнее одной статистической значимости: абсолютная разница, относительный uplift, Cohen’s d и бизнес-порог.

КПКейсПрактика5 августа 2026 г.9 мин

На большой базе микроскопический uplift становится статистически значимым, а на маленькой большой разницы может не хватить мощности. Effect size переводит результат в масштаб задачи: процентные пункты, рубли, минуты, стандартные отклонения или число предотвращённых ошибок. Без него p-value оставляет команду без ответа о практической пользе. Центральный вопрос материала: Как понять, достаточно ли велик результат, чтобы менять продукт или процесс?

Вопрос до формулы

На большой базе микроскопический uplift становится статистически значимым, а на маленькой большой разницы может не хватить мощности. Effect size переводит результат в масштаб задачи: процентные пункты, рубли, минуты, стандартные отклонения или число предотвращённых ошибок. Без него p-value оставляет команду без ответа о практической пользе.

Effect size хорошо работает в разговоре с бизнесом, потому что отвечает на вопрос «что изменится в реальности». Показывай рядом статистическую неопределённость и стоимость внедрения. Тогда решение можно принять даже при умеренном p-value, если эффект и риск понятны, или отказаться от значимого, но бесполезного изменения.

значимо не обязательно полезно

Как понять, достаточно ли велик результат, чтобы менять продукт или процесс?

Что именно измеряем

Размер эффекта бывает абсолютным, относительным и стандартизированным. Для конверсии полезнее показывать п.п. и относительный uplift, для среднего — разницу в исходных единицах, для разных шкал — Cohen’s d или другой standardized effect. Выбор зависит от решения. Один effect size не подходит одновременно для revenue, latency и retention.

До теста зафиксируй минимально полезный эффект и guardrails. После теста покажи estimate, interval и масштаб аудитории: сколько дополнительных активаций, рублей или минут это означает. Для ratio-метрик не забывай про знаменатель и maturity. Не превращай стандартизированный эффект в бизнес-обещание без обратного перевода в реальные единицы.

Относительный uplift
uplift = (metric_test − metric_control) / metric_control

Всегда добавляй абсолютную разницу и baseline.

Расчёт на примере

Изменение сократило время отчёта на 400 мс, p<0,001. Для интерактивного поиска это может быть заметным улучшением, а для ночной выгрузки — неважным. Вторая версия той же цифры — «p95 снизился с 2,1 до 1,7 секунды, 94% запросов укладываются в SLO» — помогает принять решение.

Собери decision table: effect, uncertainty, threshold, affected users, revenue or cost, guardrails. Сравни результат с baseline и исторической вариативностью. Если effect мал, но устойчив, реши, есть ли дешёвый rollout. Если effect велик, но неопределёнен, не скрывай риск за одной точкой.

Практический порог и оценка эффекта

Условный пример: решение зависит от того, пересекает ли интервал минимально полезный эффект.

Uplift, п.п.

Проверка устойчивости

До интерпретации проверь единицу наблюдения, период и правило включения. Затем пересчитай результат на небольшой выборке, где ответ известен заранее, и сравни с разумной альтернативой: другим горизонтом, зрелой когортой или user-level агрегацией.

Если показатель станет регулярным, сохрани рядом входные параметры, контрольные сверки и версию определения. Это важнее дополнительного знака после запятой.

Эффект в разных единицах
МетрикаЧто показатьПример решения
Конверсияп.п. + upliftдополнительные регистрации
Revenue₽ на user + totalмаржа и окупаемость
Latencyмс + p95SLO и опыт пользователя
Retentionп.п. по горизонтуразмер зрелой когорты
  • Зафиксируй baseline до просмотра результата.
  • Проверь пропуски, дубли и зрелость периода.
  • Покажи размер выборки и диапазон неопределённости.

Ошибки интерпретации

Нельзя сравнивать relative uplift без baseline: +50% от 0,2% и +5% от 20% — разные масштабы. Cohen’s d не учитывает бизнес-цену. Средняя разница может скрыть вред сегменту. И не называй эффект practically significant только потому, что он положительный: нужен заранее выбранный порог или явная rationale.

Пример: «Конверсия выросла на 0,7 п.п. [0,2; 1,2], что даёт около 1 400 дополнительных регистраций в месяц при текущем трафике. Эффект выше минимального порога 0,5 п.п.; ошибок и отписок не прибавилось. Рекомендуем rollout на остальные сегменты с мониторингом».

Факт → ограничение → действие

Сначала сообщи, что видно в данных. Затем назови, что мешает сделать более сильный вывод. В конце предложи один проверяемый следующий шаг.

Практика

Для трёх результатов, которые команда обсуждала недавно, переведи uplift в абсолютные единицы. Затем запиши, какой порог был бы достаточным до просмотра данных. Если его не было, обозначь это как пробел дизайна и добавь в следующий pre-analysis plan.

  • Сохрани период и параметры расчёта.
  • Назови хотя бы один крайний случай.
  • Сформулируй вывод отдельно от гипотезы о причине.

Решение для команды

Пример: «Конверсия выросла на 0,7 п.п. [0,2; 1,2], что даёт около 1 400 дополнительных регистраций в месяц при текущем трафике. Эффект выше минимального порога 0,5 п.п.; ошибок и отписок не прибавилось. Рекомендуем rollout на остальные сегменты с мониторингом».

Effect size хорошо работает в разговоре с бизнесом, потому что отвечает на вопрос «что изменится в реальности». Показывай рядом статистическую неопределённость и стоимость внедрения. Тогда решение можно принять даже при умеренном p-value, если эффект и риск понятны, или отказаться от значимого, но бесполезного изменения.

Продолжить чтение
Вся библиотека