Калькулятор значимости A/B-теста: как посчитать и как прочитать результат
Как посчитать статистическую значимость A/B-теста по двум конверсиям: какие числа нужны, что означает p-value и доверительный интервал разницы, и когда расчёт вообще не применим.
Содержание статьи
Тест закончился, в таблице две конверсии, и надо ответить на один вопрос: разница настоящая или так легло. Считать это руками не нужно — формула короткая, но ошибиться в ней легко, а прочитать результат неверно ещё легче. Разберём, какие четыре числа нужны, что выдаёт расчёт и в каких случаях им пользоваться нельзя.
Коротко
Значимость проверяется z-критерием для двух долей. Нужны только размеры групп и число конверсий в каждой.
- p-value — это не вероятность того, что вариант лучше.
- Доверительный интервал разницы важнее p-value: он показывает размер эффекта.
- Пока интервал накрывает ноль, прирост и падение одинаково согласуются с данными.
- Красивый относительный прирост на малом трафике почти всегда неубедителен.
- Перед расчётом стоит проверить сплит на перекос — иначе считать нечего.
Какие числа нужны
Четыре: сколько пользователей попало в каждую группу и сколько из них совершили целевое действие. Не проценты, а именно количества — из них конверсия считается сама, и это спасает от классической путаницы, когда в калькулятор вводят уже округлённые доли.
Целевое действие должно быть одно и одинаковое для обеих групп. Если в контроле считали заказы, а в варианте — добавления в корзину, дальше можно не читать: сравниваются разные события, и статистика тут ни при чём.
Одного пользователя нельзя считать дважды. Если метрика — заказы, а один человек сделал три, то это уже не доля, и z-критерий для долей к ней неприменим. Для таких метрик нужен критерий для средних, а лучше — заранее выбранная метрика на пользователя.
Что выдаёт расчёт
p-value отвечает ровно на один вопрос: как часто расхождение такого размера или больше возникало бы, если бы варианты на самом деле не отличались. Значение 0,03 означает, что примерно в трёх случаях из ста при полностью одинаковых вариантах вы увидели бы такую же картину. Это не вероятность того, что вариант лучше, и не вероятность ошибки.
Доверительный интервал разницы говорит о другом и обычно полезнее: насколько велика разница может быть на самом деле. У него есть единица измерения — процентные пункты, а не проценты. Разница между 10% и 12% — это два процентных пункта и одновременно двадцать процентов относительного прироста. Путаница между этими двумя числами — самая частая ошибка в отчётах.
Пока интервал накрывает ноль, данные допускают и рост, и падение. Ровно это и означает «статистически незначимо», сказанное числами вместо ярлыка.
Один и тот же прирост, разный трафик
Полезнее всего посмотреть, как ответ меняется от объёма выборки при неизменном приросте. Ниже — один и тот же рост конверсии с 10% до 12,5%, то есть +25% относительно базы, на трёх разных объёмах.
Прирост во всех трёх строках одинаковый. Меняется только уверенность, и на тысяче наблюдений её недостаточно: интервал накрывает ноль, то есть падение на четверть процентного пункта данные тоже допускают.
| Пользователей в группе | p-value | Интервал разницы, п.п. | Вывод |
|---|---|---|---|
| 1 000 | 0,0769 | от −0,27 до +5,27 | разницу нельзя считать доказанной |
| 3 000 | 0,0022 | от +0,90 до +4,10 | разница устойчива |
| 10 000 | < 0,0001 | от +1,62 до +3,38 | разница устойчива и точнее измерена |
Когда расчёт не применим
Малые числа. Нормальное приближение держится, пока в каждой из четырёх ячеек — конверсиях и отказах каждой группы — не меньше пяти наблюдений. На двадцати пользователях и трёх конверсиях калькулятор выдаст точную на вид цифру, которой нельзя верить.
Перекос сплита. Если трафик разошёлся по группам не так, как планировали, то сравниваются не два варианта, а два разных набора людей. Это проверяется отдельно и до всего остального.
Подглядывание. Если вы смотрите на p-value каждый день и останавливаете тест, как только оно опустилось ниже 0,05, то фактический уровень ошибки уже не 5%, а заметно выше. Однократный расчёт на заранее спланированной выборке — единственный способ читать эти числа так, как они задуманы.
Несколько метрик сразу. Каждая дополнительная проверка добавляет шанс случайной находки. Основная метрика должна быть выбрана до начала теста, остальное — наблюдения, а не выводы.
Разбор одного отчёта
Возьмём типичную строку из презентации: «новый экран оплаты дал +18% к конверсии, p = 0,04, выкатываем». Что здесь можно проверить, не имея доступа к данным.
Во-первых, +18% — это относительный прирост, и без базовой конверсии он ничего не говорит о размере эффекта. При базе 2% восемнадцать процентов — это 0,36 процентного пункта; при базе 30% — почти пять с половиной пунктов. Первое может не окупить и одного спринта, второе перестраивает юнит-экономику.
Во-вторых, p = 0,04 при пороге 0,05 означает, что интервал разницы почти касается нуля. Значит, нижняя граница эффекта близка к нулю: данные допускают, что реальный прирост составляет доли процентного пункта. «Значимо» и «измерено точно» — разные вещи, и второе здесь не выполнено.
В-третьих, отсутствует срок и размер выборки. Без них нельзя понять, не остановили ли тест в тот момент, когда p впервые опустилось ниже порога, — а это самая распространённая причина красивых результатов, которые не воспроизводятся после раскатки.
Полезное правило: если в выводе нет базовой конверсии, интервала и размера выборки, вывод непроверяем. Не обязательно неверен — просто его нельзя оценить со стороны.
Частые вопросы
Можно ли остановить тест раньше, если p уже меньше 0,05? Нет. Уровень 5% относится к одной проверке на заранее выбранной выборке. Если смотреть ежедневно и останавливаться на первом пересечении порога, доля ложных срабатываний вырастает в разы. Для досрочной остановки нужны последовательные критерии, а не обычный z-тест.
Что делать, если p = 0,051? То же, что при 0,04: смотреть на интервал. Порог — договорённость о дизайне, а не граница между истиной и ложью, и разница между 0,049 и 0,051 не означает ничего содержательного.
Считать по пользователям или по сессиям? По той единице, по которой шла рандомизация. Если в группы распределяли пользователей, а считать конверсию по сессиям, наблюдения перестают быть независимыми, и стандартная ошибка занижается — то есть p-value выходит меньше, чем должно.
Одна метрика упала, другая выросла — что делать? Основная метрика должна быть выбрана до старта. Остальные читаются как guardrail: они не подтверждают успех, но могут его отменить.
Тест на трёх вариантах — можно ли просто сравнить каждый с контролем? Можно, но каждое сравнение добавляет свой шанс на случайную находку. При трёх сравнениях на уровне 0,05 вероятность хотя бы одной ложной находки уже около 14%.
Абсолютная разница и относительный прирост
Одна и та же разница описывается двумя числами, и путать их — самая дорогая ошибка в отчётах об экспериментах. Рост конверсии с 2% до 2,4% — это 0,4 процентного пункта и одновременно +20% относительно базы. Первое число говорит, сколько людей добавилось; второе — во сколько раз изменился результат.
Для решения обычно нужны оба. Относительный прирост отвечает на вопрос «заметно ли это»: +20% звучит как успех при любой базе. Абсолютная разница отвечает на вопрос «сколько это в деньгах»: при ста тысячах пользователей в месяц 0,4 п.п. — это четыреста дополнительных конверсий, и дальше считается их стоимость.
Доверительный интервал всегда указывается в процентных пунктах, потому что именно эту величину измеряет критерий. Относительный интервал можно получить делением на базовую конверсию, но он несимметричен и на малых базах ведёт себя неинтуитивно — поэтому в отчётах надёжнее приводить абсолютный, добавив относительный прирост отдельным числом.
Проверить себя просто: если в выводе стоит «+20%», а рядом нет базовой конверсии, вывод неполон. По одному относительному числу нельзя понять ни размер эффекта, ни его цену.
Что делать с результатом
Значимость — не решение, а один из входов в него. Устойчивая разница в 0,3 процентных пункта может не окупать неделю разработки, а неубедительный, но крупный интервал — повод добрать трафика, а не выбросить гипотезу.
Полезная привычка: писать вывод одним предложением, в котором есть и размер эффекта, и его неопределённость. «Конверсия выросла на 2,5 п.п., интервал от 1,6 до 3,4 п.п.» — это отчёт. «Тест значим, выкатываем» — это ярлык, по которому через месяц никто не восстановит, что именно было измерено.
Материалы по теме

p-value простыми словами: что он показывает и чего не доказывает
Что на самом деле измеряет p-value, почему 0,05 — не граница истины, как читать его вместе с доверительным интервалом и что делать, когда результат «незначим».

Статистическая значимость в A/B-тесте: p-value и доверительный интервал
Объясняем статистическую значимость без магии: как читать p-value, доверительный интервал и разницу между “значимо” и “полезно для бизнеса”.

Доверительный интервал: как показать, насколько точна ваша цифра
Что означает 95% доверительный интервал для конверсии и разницы конверсий, как его посчитать, почему он важнее p-value и какая формулировка про него неверна.