Effect size: как оценивать практическую значимость результата
Что такое размер эффекта и почему он важнее одной статистической значимости: абсолютная разница, относительный uplift, Cohen’s d и бизнес-порог.
Содержание статьи
На большой базе микроскопический uplift становится статистически значимым, а на маленькой большой разницы может не хватить мощности. Effect size переводит результат в масштаб задачи: процентные пункты, рубли, минуты, стандартные отклонения или число предотвращённых ошибок. Без него p-value оставляет команду без ответа о практической пользе. Центральный вопрос материала: Как понять, достаточно ли велик результат, чтобы менять продукт или процесс?
Вопрос до формулы
На большой базе микроскопический uplift становится статистически значимым, а на маленькой большой разницы может не хватить мощности. Effect size переводит результат в масштаб задачи: процентные пункты, рубли, минуты, стандартные отклонения или число предотвращённых ошибок. Без него p-value оставляет команду без ответа о практической пользе.
Effect size хорошо работает в разговоре с бизнесом, потому что отвечает на вопрос «что изменится в реальности». Показывай рядом статистическую неопределённость и стоимость внедрения. Тогда решение можно принять даже при умеренном p-value, если эффект и риск понятны, или отказаться от значимого, но бесполезного изменения.
Как понять, достаточно ли велик результат, чтобы менять продукт или процесс?
Что именно измеряем
Размер эффекта бывает абсолютным, относительным и стандартизированным. Для конверсии полезнее показывать п.п. и относительный uplift, для среднего — разницу в исходных единицах, для разных шкал — Cohen’s d или другой standardized effect. Выбор зависит от решения. Один effect size не подходит одновременно для revenue, latency и retention.
До теста зафиксируй минимально полезный эффект и guardrails. После теста покажи estimate, interval и масштаб аудитории: сколько дополнительных активаций, рублей или минут это означает. Для ratio-метрик не забывай про знаменатель и maturity. Не превращай стандартизированный эффект в бизнес-обещание без обратного перевода в реальные единицы.
uplift = (metric_test − metric_control) / metric_controlВсегда добавляй абсолютную разницу и baseline.
Расчёт на примере
Изменение сократило время отчёта на 400 мс, p<0,001. Для интерактивного поиска это может быть заметным улучшением, а для ночной выгрузки — неважным. Вторая версия той же цифры — «p95 снизился с 2,1 до 1,7 секунды, 94% запросов укладываются в SLO» — помогает принять решение.
Собери decision table: effect, uncertainty, threshold, affected users, revenue or cost, guardrails. Сравни результат с baseline и исторической вариативностью. Если effect мал, но устойчив, реши, есть ли дешёвый rollout. Если effect велик, но неопределёнен, не скрывай риск за одной точкой.
Условный пример: решение зависит от того, пересекает ли интервал минимально полезный эффект.
Проверка устойчивости
До интерпретации проверь единицу наблюдения, период и правило включения. Затем пересчитай результат на небольшой выборке, где ответ известен заранее, и сравни с разумной альтернативой: другим горизонтом, зрелой когортой или user-level агрегацией.
Если показатель станет регулярным, сохрани рядом входные параметры, контрольные сверки и версию определения. Это важнее дополнительного знака после запятой.
| Метрика | Что показать | Пример решения |
|---|---|---|
| Конверсия | п.п. + uplift | дополнительные регистрации |
| Revenue | ₽ на user + total | маржа и окупаемость |
| Latency | мс + p95 | SLO и опыт пользователя |
| Retention | п.п. по горизонту | размер зрелой когорты |
- Зафиксируй baseline до просмотра результата.
- Проверь пропуски, дубли и зрелость периода.
- Покажи размер выборки и диапазон неопределённости.
Ошибки интерпретации
Нельзя сравнивать relative uplift без baseline: +50% от 0,2% и +5% от 20% — разные масштабы. Cohen’s d не учитывает бизнес-цену. Средняя разница может скрыть вред сегменту. И не называй эффект practically significant только потому, что он положительный: нужен заранее выбранный порог или явная rationale.
Пример: «Конверсия выросла на 0,7 п.п. [0,2; 1,2], что даёт около 1 400 дополнительных регистраций в месяц при текущем трафике. Эффект выше минимального порога 0,5 п.п.; ошибок и отписок не прибавилось. Рекомендуем rollout на остальные сегменты с мониторингом».
Сначала сообщи, что видно в данных. Затем назови, что мешает сделать более сильный вывод. В конце предложи один проверяемый следующий шаг.
Практика
Для трёх результатов, которые команда обсуждала недавно, переведи uplift в абсолютные единицы. Затем запиши, какой порог был бы достаточным до просмотра данных. Если его не было, обозначь это как пробел дизайна и добавь в следующий pre-analysis plan.
- Сохрани период и параметры расчёта.
- Назови хотя бы один крайний случай.
- Сформулируй вывод отдельно от гипотезы о причине.
Решение для команды
Пример: «Конверсия выросла на 0,7 п.п. [0,2; 1,2], что даёт около 1 400 дополнительных регистраций в месяц при текущем трафике. Эффект выше минимального порога 0,5 п.п.; ошибок и отписок не прибавилось. Рекомендуем rollout на остальные сегменты с мониторингом».
Effect size хорошо работает в разговоре с бизнесом, потому что отвечает на вопрос «что изменится в реальности». Показывай рядом статистическую неопределённость и стоимость внедрения. Тогда решение можно принять даже при умеренном p-value, если эффект и риск понятны, или отказаться от значимого, но бесполезного изменения.
Материалы по теме

Статистическая значимость в A/B-тесте: p-value и доверительный интервал
Объясняем статистическую значимость без магии: как читать p-value, доверительный интервал и разницу между “значимо” и “полезно для бизнеса”.

Основная метрика и guardrail в A/B-тесте: что считать успехом
Как выбрать primary metric, вторичные показатели и guardrail-метрики для эксперимента, чтобы не объявить победу ценой ухудшения продукта.
T-test и z-test: какой тест выбрать для сравнения средних и долей
Практическое сравнение t-test и z-test для аналитика: когда использовать тест для средних, когда для долей, какие допущения проверить и чем не заменить эксперимент.