Статистическая значимость в A/B-тесте: p-value и доверительный интервал
Объясняем статистическую значимость без магии: как читать p-value, доверительный интервал и разницу между “значимо” и “полезно для бизнеса”.
Содержание статьи
В отчёте написано: “конверсия выросла на 3 п.п., p-value = 0,03”. Звучит убедительно, но этого мало для решения. Нужно понять, насколько широк диапазон возможных эффектов, какой результат считали основной метрикой и окупает ли ожидаемый uplift стоимость внедрения.
Коротко
Статистическая значимость отвечает на вопрос: насколько совместимы наблюдаемые данные с отсутствием разницы при выбранной модели и пороге. Она не говорит, что вариант точно лучше, насколько велик эффект или что его нужно выкатывать.
- p-value — не вероятность того, что гипотеза верна.
- Доверительный интервал показывает диапазон правдоподобных эффектов и помогает оценить неопределённость.
- Смотри на абсолютную разницу и относительный uplift вместе.
- Решение зависит от эффекта, стоимости и guardrail-метрик, а не от одной галочки “p < 0,05”.
Что на самом деле говорит p-value
Представь, что в реальности варианты не отличаются. p-value показывает, насколько необычным был бы такой результат или ещё более сильный при этой предпосылке. Маленькое значение — повод пересмотреть гипотезу об отсутствии разницы, но не готовое доказательство причинности.
Порог 0,05 — договорённость для конкретного дизайна, а не природный закон. Если тест смотрели двадцать раз, проверяли много метрик или нарушили рандомизацию, интерпретация меняется даже при маленьком p-value.
Он не говорит: “какова вероятность, что test лучше”, “насколько велик эффект” и “стоит ли релиз денег”. Для этого нужны доверительный интервал, бизнес-расчёт и контроль качества эксперимента.
Доверительный интервал возвращает размер эффекта
Если конверсия в control равна 10%, в test — 10,8%, а 95%-й интервал для разницы составляет от −0,1 до +1,7 п.п., данных пока недостаточно, чтобы уверенно отличить небольшой минус от заметного плюса. Точка 0 попадает в интервал — поэтому результат обычно называют статистически неубедительным.
Если интервал находится от +0,4 до +1,8 п.п., направление результата устойчивее. Но дальше остаётся бизнес-вопрос: минимально полезный эффект для команды — 0,3, 1 или 3 п.п.? Статистика не знает этого порога за вас.
Условный пример. Пересечение нулевой линии означает, что направление результата ещё не определено достаточно уверенно.
“Значимо” не равно “важно”
На большой аудитории статистически значимым может стать uplift в 0,05 п.п. Если изменение почти ничего не даёт, но усложняет код и увеличивает поддержку, такой результат не обязан идти в релиз. На маленькой аудитории, наоборот, полезный эффект может остаться незначимым из-за широкого интервала.
| Результат | Что сказать команде |
|---|---|
| p < 0,05, эффект ниже MDE | Разница заметна, но меньше заранее полезного порога. Оценить стоимость и риск. |
| p > 0,05, интервал узкий около нуля | Сильного эффекта, скорее всего, нет. Не путать с доказательством полного равенства. |
| p > 0,05, интервал широкий | Данных недостаточно: тест не различает небольшой минус и заметный плюс. |
| p < 0,05, guardrail ухудшился | Primary metric не отменяет риск. Нужна сегментация или остановка по правилу. |
Как написать честный вывод
Хороший вывод содержит не только p-value. Укажи аудиторию и период, абсолютную метрику в обеих группах, разницу, доверительный интервал, primary metric, guardrails и следующий шаг. Не прячь неопределённость за словом “тренд”.
- Control: 10,0%, test: 11,1%.
- Абсолютная разница: +1,1 п.п.; относительный uplift: +11%.
- 95%-й интервал разницы: от +0,4 до +1,8 п.п.
- Guardrail без заметного ухудшения.
- Решение: раскатить на следующий сегмент или продолжить сбор данных, если порог внедрения выше нижней границы.
Абсолютная разница и относительный uplift
Одна и та же разница может выглядеть по-разному в зависимости от масштаба. Рост конверсии с 10,0% до 11,0% — это +1 процентный пункт и +10% относительно control. В отчёте нужны оба числа: процентные пункты показывают изменение самой доли, а относительный uplift помогает оценить масштаб относительно базы. Если оставить только “+10%”, читатель легко представит эффект намного крупнее реального.
Для редких событий особенно важно показать знаменатель и число пользователей. Конверсия 2 из 100 и 200 из 10 000 может выглядеть одинаково в процентах, но неопределённость у первой оценки будет намного шире. Процент без размера выборки скрывает качество измерения.
absolute = test − control; relative uplift = (test − control) / control × 100%Не смешивай процентные пункты и проценты. В тексте всегда называй единицу измерения.
| Control | Test | Разница | Uplift |
|---|---|---|---|
| 10,0% | 11,0% | +1,0 п.п. | +10% |
| 2,0% | 2,4% | +0,4 п.п. | +20% |
| 40,0% | 40,5% | +0,5 п.п. | +1,25% |
Почему статистическая значимость может обмануть
Маленькое p-value становится убедительным только внутри корректного дизайна. Если пользователи распределялись неслучайно, часть событий потерялась, тест смотрели каждый день или primary metric выбрали после результата, формальная значимость уже не означает надёжный продуктовый вывод. Поэтому статистический блок всегда должен идти после проверки качества эксперимента.
Есть и обратная ошибка: команда видит p-value выше 0,05 и пишет “варианты одинаковы”. Это слишком сильное утверждение. Возможно, интервал широк и тест не способен различить полезный эффект от небольшого минуса. Корректная формулировка — “данных недостаточно для уверенного вывода при заданной чувствительности”.
- Проверь, была ли primary metric задана до запуска.
- Сверь SRM и полноту exposure.
- Проверь окно конверсии и задержку событий.
- Отдели подтверждающие метрики от исследовательских срезов.
Как читать широкий и узкий интервал
Широкий интервал — это не просто “плохая статистика”. Он показывает, какие решения ещё совместимы с данными. Например, диапазон от −0,3 до +1,8 п.п. допускает и небольшой вред, и заметный рост. В такой ситуации стоит либо собрать больше наблюдений, либо выбрать решение с меньшим риском, а не рассказывать команде только о точечной оценке +0,7 п.п.
Узкий интервал около нуля полезен даже без статистической “победы”. Если диапазон от −0,1 до +0,2 п.п., крупное изменение конверсии становится маловероятным. Это может быть достаточным основанием закрыть гипотезу, если бизнесу нужен эффект не меньше 0,5 п.п.
Условные диапазоны эффекта. Важен не только знак точечной оценки, но и весь диапазон, совместимый с данными.
Шаблон финального вывода
Финальный вывод должен позволить руководителю принять решение без повторной расшифровки статистики. Сначала назови аудиторию и окно, затем абсолютные значения, интервал и ограничения. После этого скажи, что делать. Если есть риск или незакрытый вопрос, вынеси его в следующий шаг, а не прячь в примечании.
Пример: “За 21 день и 18 400 пользователей на группу checkout completion составил 10,0% в control и 11,1% в test. Разница +1,1 п.п., 95%-й интервал от +0,4 до +1,8 п.п. Refund rate не изменился заметно. Эффект выше MDE 0,8 п.п., поэтому предлагаем staged rollout на 25% трафика и повторную проверку мобильного сегмента”.
| Блок | Что написать |
|---|---|
| Контекст | кто участвовал, период и окно конверсии |
| Метрика | control, test, абсолютная разница и uplift |
| Неопределённость | доверительный интервал и p-value, если он нужен |
| Качество | SRM, tracking, primary и guardrails |
| Решение | раскатить, продолжить, остановить или исследовать сегмент |
Статистическая значимость не заменяет причинность
Даже маленькое p-value не исправит ситуацию, если test и control различались до эксперимента или получили разные условия. Причинный вывод появляется из рандомизации, стабильного назначения и одинакового измерения, а не из самого числа в статистическом отчёте. Если в test чаще попадали новые пользователи, эффект может быть следствием состава групп.
Перед интерпретацией сравни baseline-показатели и технические условия. Это не значит, что каждое небольшое различие в начале делает тест бесполезным: случайный шум возможен. Но систематическая разница, SRM, смена аудитории или разные даты подключения требуют расследования до обсуждения p-value.
| Условие | Что проверяем |
|---|---|
| Рандомизация | пользователь не выбирает вариант сам |
| Стабильность | вариант не меняется между сессиями |
| Сопоставимость | группы видят одинаковое окно и правила включения |
| Измерение | события и знаменатель одинаково доступны |
| План | primary и правило остановки заданы заранее |
Результат может отличаться по сегментам
Общий эффект — это среднее по аудитории, а продуктовое решение часто зависит от того, кому именно показали изменение. Новый пользователь может выиграть от подсказки, а опытный — раздражаться. Мобильная версия может получить пользу от сокращённой формы, а desktop потерять контекст. Сегментный анализ помогает увидеть механизм и риск, но не даёт права автоматически объявить отдельную группу победителем.
Если сегмент был запланирован заранее и выборка достаточна, его можно включить в основной вывод. Если он найден после просмотра десятков разрезов, обозначь его как exploratory и сформулируй отдельную гипотезу. Для раскатки используй staged rollout: сначала проверить найденный риск, затем расширять аудиторию.
Условный пример. Средняя точка не объясняет, почему результат различается между новыми и возвращающимися пользователями.
Как объяснить статистику руководителю
Не начинай с формулы и не прячь главный смысл за p-value. Сначала скажи, какое решение проверяли, на какой аудитории и какой эффект наблюдаем. Затем добавь диапазон неопределённости и ограничения. Руководителю важно понимать не только “значимо ли”, но и какие варианты действия совместимы с данными.
Хорошая фраза выглядит так: “Вариант B дал +1,1 п.п. к checkout completion. Наиболее правдоподобный диапазон — от +0,4 до +1,8 п.п.; крупный минус данные не поддерживают. Эффект выше минимального полезного порога, guardrail не ухудшился, поэтому предлагаем rollout на 25% и контроль возвратов”. Это яснее, чем “p-value = 0,03, значит победа”.
- Решение и аудитория.
- Control и test в абсолютных единицах.
- Абсолютная разница и диапазон.
- Primary, guardrails и ограничения дизайна.
- Следующее действие и условие пересмотра.
После теста обнови знание, а не только статус
Закрытый эксперимент должен изменить backlog. Запиши, какой механизм подтвердился, какой не подтвердился и что осталось неизвестным. Нейтральный результат может означать отсутствие крупного эффекта, недостаточную мощность или ошибку в гипотезе. Эти варианты ведут к разным решениям, поэтому не складывай их в одну папку “не сработало”.
Сохрани ссылку на расчёт, исходные фильтры, версии событий и дату финального чтения. Через месяц команда должна суметь понять, почему решение было принято и можно ли сравнить его с новым тестом. Так статистика становится частью продукта, а не одноразовым числом в презентации.
Добавь дату следующего review, если эффект должен проявиться с задержкой.
Мини-кейс: значимо, но ниже полезного порога
Представим сервис с конверсией регистрации 20%. После изменения форма даёт 20,3%, а на большой аудитории интервал узкий и не пересекает ноль. Формально разница статистически убедительна. Но до запуска команда записала MDE 1 п.п.: только такой рост окупает разработку, поддержку и дополнительные письма. Значит, корректный вывод — эффект обнаружен, но он меньше порога решения.
Обратная ситуация тоже важна. При маленькой выборке test показывает 22%, control — 20%, но интервал от −0,5 до +4,5 п.п. Нельзя объявить победу и нельзя сказать, что варианты равны. Данные совместимы с небольшим вредом и заметным ростом. Решение зависит от цены продолжения, риска и того, можно ли собрать ещё наблюдения.
MDE превращает статистический отчёт в рабочий контракт. Он заранее говорит, какой вопрос мы способны решить. Если команда хочет заметить эффект меньше, нужно изменить план: увеличить трафик, продлить срок, улучшить метрику или признать, что задача не подходит для A/B-теста с текущими ресурсами.
| Ситуация | Статистика | Решение |
|---|---|---|
| Эффект выше MDE | интервал поддерживает полезный uplift | staged rollout при чистых guardrails |
| Эффект значим, но ниже MDE | разница реальна, но бизнес-порог не достигнут | оценить стоимость и не объявлять победу автоматически |
| Эффект незначим, интервал широкий | тест не различает сценарии | продолжить или изменить дизайн |
| Эффект незначим, интервал узкий | крупный результат маловероятен | закрыть гипотезу и перейти дальше |
Как выбрать действие при неопределённости
Неопределённость не означает, что решение невозможно. Свяжи диапазон эффекта с обратимостью изменения: маленький риск допускает ограниченный rollout, дорогой риск требует продолжения или дополнительной проверки. Зафиксируй это правило до чтения результата, чтобы не менять стандарт под удобную цифру.
- Низкий риск и широкий интервал — staged rollout с мониторингом.
- Высокий риск и широкий интервал — не раскатывать.
- Узкий интервал около нуля — закрыть крупную гипотезу.
Что делать с результатом около порога
Иногда оценка эффекта находится рядом с MDE, а интервал пересекает и полезную, и нейтральную зоны. Не превращай это в спор о последней цифре. Сначала назови диапазон решений: какие значения означают rollout, какие требуют продолжения, а какие делают гипотезу невыгодной. Затем проверь, изменится ли решение при разумном сценарии стоимости и риска.
Для дешёвого обратимого изменения допустим staged rollout. Для дорогого или рискованного релиза нужен более узкий интервал, дополнительная выборка или отдельная проверка механизма. Так статистика поддерживает решение, а не создаёт бинарную галочку “успех”.
- Эффект ниже полезного порога — не называть победой.
- Интервал широкий — не называть равенством.
- Риск дорогой — требовать более строгого решения.
- Изменение обратимое — использовать контролируемый rollout.
Порог полезности связан с экономикой
MDE не обязан быть только статистическим параметром. Для коммерческого изменения переведи его в деньги: сколько дополнительных заказов, маржи или удержанных клиентов нужно, чтобы окупить разработку и риск. Тогда команда понимает, почему +0,2 п.п. может быть недостаточно, даже если результат устойчив, а +1 п.п. имеет смысл проверять дальше.
Если эффект находится около порога, покажи чувствительность решения: что будет при нижней и верхней границе интервала. Это честнее, чем выбирать точечную оценку как единственный сценарий. Такой формат помогает договориться о rollout без ложной точности.
Зафиксируй этот порог в brief до запуска и используй его одинаково в отчёте, обсуждении и staged rollout.
MUE = стоимость изменения / ценность дополнительного результатаMUE отвечает на бизнес-вопрос, а MDE — на вопрос статистической обнаружимости. В плане нужны оба.
Материалы по теме

p-value простыми словами: что он показывает и чего не доказывает
Что на самом деле измеряет p-value, почему 0,05 — не граница истины, как читать его вместе с доверительным интервалом и что делать, когда результат «незначим».

Основная метрика и guardrail в A/B-тесте: что считать успехом
Как выбрать primary metric, вторичные показатели и guardrail-метрики для эксперимента, чтобы не объявить победу ценой ухудшения продукта.

Доверительный интервал: как показать, насколько точна ваша цифра
Что означает 95% доверительный интервал для конверсии и разницы конверсий, как его посчитать, почему он важнее p-value и какая формулировка про него неверна.