Все материалы
Продуктовая аналитикагайдсредний

Статистическая значимость в A/B-тесте: p-value и доверительный интервал

Объясняем статистическую значимость без магии: как читать p-value, доверительный интервал и разницу между “значимо” и “полезно для бизнеса”.

КПКейсПрактика26 июля 2026 г.16 мин

В отчёте написано: “конверсия выросла на 3 п.п., p-value = 0,03”. Звучит убедительно, но этого мало для решения. Нужно понять, насколько широк диапазон возможных эффектов, какой результат считали основной метрикой и окупает ли ожидаемый uplift стоимость внедрения.

Коротко

Статистическая значимость отвечает на вопрос: насколько совместимы наблюдаемые данные с отсутствием разницы при выбранной модели и пороге. Она не говорит, что вариант точно лучше, насколько велик эффект или что его нужно выкатывать.

  • p-value — не вероятность того, что гипотеза верна.
  • Доверительный интервал показывает диапазон правдоподобных эффектов и помогает оценить неопределённость.
  • Смотри на абсолютную разницу и относительный uplift вместе.
  • Решение зависит от эффекта, стоимости и guardrail-метрик, а не от одной галочки “p < 0,05”.

Что на самом деле говорит p-value

Представь, что в реальности варианты не отличаются. p-value показывает, насколько необычным был бы такой результат или ещё более сильный при этой предпосылке. Маленькое значение — повод пересмотреть гипотезу об отсутствии разницы, но не готовое доказательство причинности.

Порог 0,05 — договорённость для конкретного дизайна, а не природный закон. Если тест смотрели двадцать раз, проверяли много метрик или нарушили рандомизацию, интерпретация меняется даже при маленьком p-value.

p-value не отвечает на три популярных вопроса

Он не говорит: “какова вероятность, что test лучше”, “насколько велик эффект” и “стоит ли релиз денег”. Для этого нужны доверительный интервал, бизнес-расчёт и контроль качества эксперимента.

Доверительный интервал возвращает размер эффекта

Если конверсия в control равна 10%, в test — 10,8%, а 95%-й интервал для разницы составляет от −0,1 до +1,7 п.п., данных пока недостаточно, чтобы уверенно отличить небольшой минус от заметного плюса. Точка 0 попадает в интервал — поэтому результат обычно называют статистически неубедительным.

Если интервал находится от +0,4 до +1,8 п.п., направление результата устойчивее. Но дальше остаётся бизнес-вопрос: минимально полезный эффект для команды — 0,3, 1 или 3 п.п.? Статистика не знает этого порога за вас.

Три результата A/B-теста и диапазон возможного эффекта, п.п.

Условный пример. Пересечение нулевой линии означает, что направление результата ещё не определено достаточно уверенно.

Нижняя границаОценка upliftВерхняя граница

“Значимо” не равно “важно”

На большой аудитории статистически значимым может стать uplift в 0,05 п.п. Если изменение почти ничего не даёт, но усложняет код и увеличивает поддержку, такой результат не обязан идти в релиз. На маленькой аудитории, наоборот, полезный эффект может остаться незначимым из-за широкого интервала.

Как читать статистику вместе с бизнес-смыслом
РезультатЧто сказать команде
p < 0,05, эффект ниже MDEРазница заметна, но меньше заранее полезного порога. Оценить стоимость и риск.
p > 0,05, интервал узкий около нуляСильного эффекта, скорее всего, нет. Не путать с доказательством полного равенства.
p > 0,05, интервал широкийДанных недостаточно: тест не различает небольшой минус и заметный плюс.
p < 0,05, guardrail ухудшилсяPrimary metric не отменяет риск. Нужна сегментация или остановка по правилу.

Как написать честный вывод

Хороший вывод содержит не только p-value. Укажи аудиторию и период, абсолютную метрику в обеих группах, разницу, доверительный интервал, primary metric, guardrails и следующий шаг. Не прячь неопределённость за словом “тренд”.

  • Control: 10,0%, test: 11,1%.
  • Абсолютная разница: +1,1 п.п.; относительный uplift: +11%.
  • 95%-й интервал разницы: от +0,4 до +1,8 п.п.
  • Guardrail без заметного ухудшения.
  • Решение: раскатить на следующий сегмент или продолжить сбор данных, если порог внедрения выше нижней границы.

Абсолютная разница и относительный uplift

Одна и та же разница может выглядеть по-разному в зависимости от масштаба. Рост конверсии с 10,0% до 11,0% — это +1 процентный пункт и +10% относительно control. В отчёте нужны оба числа: процентные пункты показывают изменение самой доли, а относительный uplift помогает оценить масштаб относительно базы. Если оставить только “+10%”, читатель легко представит эффект намного крупнее реального.

Для редких событий особенно важно показать знаменатель и число пользователей. Конверсия 2 из 100 и 200 из 10 000 может выглядеть одинаково в процентах, но неопределённость у первой оценки будет намного шире. Процент без размера выборки скрывает качество измерения.

Две формы одного эффекта
absolute = test − control; relative uplift = (test − control) / control × 100%

Не смешивай процентные пункты и проценты. В тексте всегда называй единицу измерения.

Как не потерять масштаб результата
ControlTestРазницаUplift
10,0%11,0%+1,0 п.п.+10%
2,0%2,4%+0,4 п.п.+20%
40,0%40,5%+0,5 п.п.+1,25%

Почему статистическая значимость может обмануть

Маленькое p-value становится убедительным только внутри корректного дизайна. Если пользователи распределялись неслучайно, часть событий потерялась, тест смотрели каждый день или primary metric выбрали после результата, формальная значимость уже не означает надёжный продуктовый вывод. Поэтому статистический блок всегда должен идти после проверки качества эксперимента.

Есть и обратная ошибка: команда видит p-value выше 0,05 и пишет “варианты одинаковы”. Это слишком сильное утверждение. Возможно, интервал широк и тест не способен различить полезный эффект от небольшого минуса. Корректная формулировка — “данных недостаточно для уверенного вывода при заданной чувствительности”.

  • Проверь, была ли primary metric задана до запуска.
  • Сверь SRM и полноту exposure.
  • Проверь окно конверсии и задержку событий.
  • Отдели подтверждающие метрики от исследовательских срезов.

Как читать широкий и узкий интервал

Широкий интервал — это не просто “плохая статистика”. Он показывает, какие решения ещё совместимы с данными. Например, диапазон от −0,3 до +1,8 п.п. допускает и небольшой вред, и заметный рост. В такой ситуации стоит либо собрать больше наблюдений, либо выбрать решение с меньшим риском, а не рассказывать команде только о точечной оценке +0,7 п.п.

Узкий интервал около нуля полезен даже без статистической “победы”. Если диапазон от −0,1 до +0,2 п.п., крупное изменение конверсии становится маловероятным. Это может быть достаточным основанием закрыть гипотезу, если бизнесу нужен эффект не меньше 0,5 п.п.

Ширина интервала меняет решение

Условные диапазоны эффекта. Важен не только знак точечной оценки, но и весь диапазон, совместимый с данными.

Нижняя границаОценкаВерхняя граница

Шаблон финального вывода

Финальный вывод должен позволить руководителю принять решение без повторной расшифровки статистики. Сначала назови аудиторию и окно, затем абсолютные значения, интервал и ограничения. После этого скажи, что делать. Если есть риск или незакрытый вопрос, вынеси его в следующий шаг, а не прячь в примечании.

Пример: “За 21 день и 18 400 пользователей на группу checkout completion составил 10,0% в control и 11,1% в test. Разница +1,1 п.п., 95%-й интервал от +0,4 до +1,8 п.п. Refund rate не изменился заметно. Эффект выше MDE 0,8 п.п., поэтому предлагаем staged rollout на 25% трафика и повторную проверку мобильного сегмента”.

Минимальный формат результата эксперимента
БлокЧто написать
Контексткто участвовал, период и окно конверсии
Метрикаcontrol, test, абсолютная разница и uplift
Неопределённостьдоверительный интервал и p-value, если он нужен
КачествоSRM, tracking, primary и guardrails
Решениераскатить, продолжить, остановить или исследовать сегмент

Статистическая значимость не заменяет причинность

Даже маленькое p-value не исправит ситуацию, если test и control различались до эксперимента или получили разные условия. Причинный вывод появляется из рандомизации, стабильного назначения и одинакового измерения, а не из самого числа в статистическом отчёте. Если в test чаще попадали новые пользователи, эффект может быть следствием состава групп.

Перед интерпретацией сравни baseline-показатели и технические условия. Это не значит, что каждое небольшое различие в начале делает тест бесполезным: случайный шум возможен. Но систематическая разница, SRM, смена аудитории или разные даты подключения требуют расследования до обсуждения p-value.

Что нужно для причинного вывода
УсловиеЧто проверяем
Рандомизацияпользователь не выбирает вариант сам
Стабильностьвариант не меняется между сессиями
Сопоставимостьгруппы видят одинаковое окно и правила включения
Измерениесобытия и знаменатель одинаково доступны
Планprimary и правило остановки заданы заранее

Результат может отличаться по сегментам

Общий эффект — это среднее по аудитории, а продуктовое решение часто зависит от того, кому именно показали изменение. Новый пользователь может выиграть от подсказки, а опытный — раздражаться. Мобильная версия может получить пользу от сокращённой формы, а desktop потерять контекст. Сегментный анализ помогает увидеть механизм и риск, но не даёт права автоматически объявить отдельную группу победителем.

Если сегмент был запланирован заранее и выборка достаточна, его можно включить в основной вывод. Если он найден после просмотра десятков разрезов, обозначь его как exploratory и сформулируй отдельную гипотезу. Для раскатки используй staged rollout: сначала проверить найденный риск, затем расширять аудиторию.

Один общий эффект может скрывать разные сегменты

Условный пример. Средняя точка не объясняет, почему результат различается между новыми и возвращающимися пользователями.

Uplift, п.п.MDE, п.п.

Как объяснить статистику руководителю

Не начинай с формулы и не прячь главный смысл за p-value. Сначала скажи, какое решение проверяли, на какой аудитории и какой эффект наблюдаем. Затем добавь диапазон неопределённости и ограничения. Руководителю важно понимать не только “значимо ли”, но и какие варианты действия совместимы с данными.

Хорошая фраза выглядит так: “Вариант B дал +1,1 п.п. к checkout completion. Наиболее правдоподобный диапазон — от +0,4 до +1,8 п.п.; крупный минус данные не поддерживают. Эффект выше минимального полезного порога, guardrail не ухудшился, поэтому предлагаем rollout на 25% и контроль возвратов”. Это яснее, чем “p-value = 0,03, значит победа”.

  • Решение и аудитория.
  • Control и test в абсолютных единицах.
  • Абсолютная разница и диапазон.
  • Primary, guardrails и ограничения дизайна.
  • Следующее действие и условие пересмотра.

После теста обнови знание, а не только статус

Закрытый эксперимент должен изменить backlog. Запиши, какой механизм подтвердился, какой не подтвердился и что осталось неизвестным. Нейтральный результат может означать отсутствие крупного эффекта, недостаточную мощность или ошибку в гипотезе. Эти варианты ведут к разным решениям, поэтому не складывай их в одну папку “не сработало”.

Сохрани ссылку на расчёт, исходные фильтры, версии событий и дату финального чтения. Через месяц команда должна суметь понять, почему решение было принято и можно ли сравнить его с новым тестом. Так статистика становится частью продукта, а не одноразовым числом в презентации.

Добавь дату следующего review, если эффект должен проявиться с задержкой.

Мини-кейс: значимо, но ниже полезного порога

Представим сервис с конверсией регистрации 20%. После изменения форма даёт 20,3%, а на большой аудитории интервал узкий и не пересекает ноль. Формально разница статистически убедительна. Но до запуска команда записала MDE 1 п.п.: только такой рост окупает разработку, поддержку и дополнительные письма. Значит, корректный вывод — эффект обнаружен, но он меньше порога решения.

Обратная ситуация тоже важна. При маленькой выборке test показывает 22%, control — 20%, но интервал от −0,5 до +4,5 п.п. Нельзя объявить победу и нельзя сказать, что варианты равны. Данные совместимы с небольшим вредом и заметным ростом. Решение зависит от цены продолжения, риска и того, можно ли собрать ещё наблюдения.

MDE превращает статистический отчёт в рабочий контракт. Он заранее говорит, какой вопрос мы способны решить. Если команда хочет заметить эффект меньше, нужно изменить план: увеличить трафик, продлить срок, улучшить метрику или признать, что задача не подходит для A/B-теста с текущими ресурсами.

Как MDE меняет формулировку вывода
СитуацияСтатистикаРешение
Эффект выше MDEинтервал поддерживает полезный upliftstaged rollout при чистых guardrails
Эффект значим, но ниже MDEразница реальна, но бизнес-порог не достигнутоценить стоимость и не объявлять победу автоматически
Эффект незначим, интервал широкийтест не различает сценариипродолжить или изменить дизайн
Эффект незначим, интервал узкийкрупный результат маловероятензакрыть гипотезу и перейти дальше

Как выбрать действие при неопределённости

Неопределённость не означает, что решение невозможно. Свяжи диапазон эффекта с обратимостью изменения: маленький риск допускает ограниченный rollout, дорогой риск требует продолжения или дополнительной проверки. Зафиксируй это правило до чтения результата, чтобы не менять стандарт под удобную цифру.

  • Низкий риск и широкий интервал — staged rollout с мониторингом.
  • Высокий риск и широкий интервал — не раскатывать.
  • Узкий интервал около нуля — закрыть крупную гипотезу.

Что делать с результатом около порога

Иногда оценка эффекта находится рядом с MDE, а интервал пересекает и полезную, и нейтральную зоны. Не превращай это в спор о последней цифре. Сначала назови диапазон решений: какие значения означают rollout, какие требуют продолжения, а какие делают гипотезу невыгодной. Затем проверь, изменится ли решение при разумном сценарии стоимости и риска.

Для дешёвого обратимого изменения допустим staged rollout. Для дорогого или рискованного релиза нужен более узкий интервал, дополнительная выборка или отдельная проверка механизма. Так статистика поддерживает решение, а не создаёт бинарную галочку “успех”.

  • Эффект ниже полезного порога — не называть победой.
  • Интервал широкий — не называть равенством.
  • Риск дорогой — требовать более строгого решения.
  • Изменение обратимое — использовать контролируемый rollout.

Порог полезности связан с экономикой

MDE не обязан быть только статистическим параметром. Для коммерческого изменения переведи его в деньги: сколько дополнительных заказов, маржи или удержанных клиентов нужно, чтобы окупить разработку и риск. Тогда команда понимает, почему +0,2 п.п. может быть недостаточно, даже если результат устойчив, а +1 п.п. имеет смысл проверять дальше.

Если эффект находится около порога, покажи чувствительность решения: что будет при нижней и верхней границе интервала. Это честнее, чем выбирать точечную оценку как единственный сценарий. Такой формат помогает договориться о rollout без ложной точности.

Зафиксируй этот порог в brief до запуска и используй его одинаково в отчёте, обсуждении и staged rollout.

Минимально полезный эффект
MUE = стоимость изменения / ценность дополнительного результата

MUE отвечает на бизнес-вопрос, а MDE — на вопрос статистической обнаружимости. В плане нужны оба.

Продолжить чтение
Вся библиотека