Калькулятор размера выборки для A/B-теста: сколько трафика и дней нужно
Как рассчитать размер выборки и длительность A/B-теста: что такое MDE, откуда берутся уровень доверия и мощность, и почему вдвое меньший эффект стоит вчетверо большего трафика.
Содержание статьи
Тест запускают, ждут две недели, смотрят на результат — и он неубедителен. Иногда это значит, что изменение не работает. Гораздо чаще это значит, что трафика изначально не хватало, чтобы заметить эффект того размера, на который рассчитывали. Разница между этими двумя случаями выясняется до запуска, за пару минут.
Коротко
Размер выборки считается из четырёх величин: базовой конверсии, минимального эффекта, который тест обязан заметить, уровня доверия и мощности.
- MDE выбирают из бизнеса, а не из статистики: какой прирост окупает работу.
- Размер выборки растёт как квадрат обратного эффекта — вдвое меньший MDE стоит вчетверо больше трафика.
- Мощность 80% означает, что каждый пятый реальный эффект тест пропустит.
- Тест длиннее четырёх недель обычно измеряет уже не только ваше изменение.
- Если нужного трафика нет, честнее пересмотреть гипотезу, чем ждать.
MDE: первое число, которое надо назвать
MDE — минимальный детектируемый эффект, тот прирост, который тест обязан отличить от нуля. Его выбирают не статистики, а продукт: какое улучшение окупает разработку, релиз и поддержку. Всё, что меньше, тест не увидит — и это нормально, если такой прирост всё равно не окупился бы.
Ошибка здесь всегда одна и та же: MDE берут «поменьше, чтобы точно поймать». Меньший MDE не делает тест чувствительнее бесплатно — он делает его длиннее, причём непропорционально.
Полезно называть эффект относительным: «поймать +10% к конверсии» понятнее, чем «+0,5 процентного пункта». Но в формулу идёт абсолютная величина, и держать в голове перевод между ними обязательно: при базе 5% относительные 10% — это половина процентного пункта.
Почему меньший эффект стоит непропорционально дороже
Размер выборки обратно пропорционален квадрату эффекта. На практике это значит: уменьшили MDE вдвое — умножьте выборку примерно на четыре. Ниже одна и та же базовая конверсия 5% и разные аппетиты по эффекту, при уровне доверия 95% и мощности 80%.
Из этой таблицы обычно следует не «набрать больше трафика», а другой разговор: действительно ли нам нужно ловить +5%, или продукту интересен только прирост от +10% и выше. Второй вопрос отвечается за минуту, первый — за четыре месяца ожидания.
| Относительный эффект | В процентных пунктах | На группу | Дней при 2 000/сут |
|---|---|---|---|
| +20% | 1,00 п.п. | 8 158 | 9 |
| +10% | 0,50 п.п. | 31 234 | 32 |
| +5% | 0,25 п.п. | 122 124 | 123 |
| +3% | 0,15 п.п. | 336 102 | 337 |
Базовая конверсия 5%, доверие 95%, мощность 80%. Шкала размера выборки логарифмическая.
Уровень доверия и мощность: две разные ошибки
Уровень доверия отвечает за ложную тревогу: как часто мы объявим разницу там, где её нет. 95% означают, что при полностью одинаковых вариантах мы ошибёмся примерно в одном случае из двадцати.
Мощность отвечает за противоположную ошибку — пропуск. Стандартные 80% означают, что реально существующий эффект нужного размера тест не заметит в одном случае из пяти. Это не «безопасный» выбор, а просто привычный: цена пропуска молчаливая, поэтому её редко считают.
Поднять и то и другое можно, но платить придётся трафиком. При базовой конверсии 5% и эффекте в половину процентного пункта переход с мощности 80% на 90% добавляет к выборке треть — с 31 234 до 41 813 на группу. Переход с доверия 95% на 99% дороже почти вдвое сильнее: 46 476, то есть в полтора раза больше исходного.
Из наблюдений в дни
Размер выборки сам по себе мало что говорит команде. Разделите общее число на суточный трафик, который реально попадает в тест, — и получите срок. Именно этот срок и обсуждают на планировании.
Считать надо трафик, попадающий в эксперимент, а не всех посетителей сайта. Если тест раскатан на 20% аудитории, срок вырастет впятеро.
Тест длиннее четырёх недель стоит считать отдельным риском. За месяц меняются сезон, состав трафика и сам продукт, и разница между группами перестаёт объясняться одним вашим изменением. Ждать полгода ради +3% почти никогда не имеет смысла.
Как это выглядит на планировании
Продукт предлагает переделать экран корзины. Текущая конверсия из корзины в оплату — 22%, в тест попадает половина трафика, это около 1 400 пользователей в сутки на обе группы.
Первый вопрос не «сколько ждать», а «какой прирост мы готовы внедрять». Разработка займёт две недели, поддержка нового экрана — ещё время дизайнера; команда сходится на том, что меньше +5% относительно текущей конверсии внедрять не станут. Это и есть MDE: 5% от 22%, то есть 1,1 процентного пункта.
Подставляем: базовая 22%, эффект 1,1 п.п., доверие 95%, мощность 80% — выходит 22 657 наблюдений на группу, 45 314 всего, тридцать три дня. И это уже плохая новость: месяц с лишним выходит за границу, после которой на результат начинают влиять сезон и другие релизы.
Дальше разговор становится содержательным. Если поднять планку до +10% — то есть 2,2 п.п. — нужно 5 761 наблюдение на группу и девять дней. Вопрос к продукту получается конкретный: готовы ли мы внедрять прирост меньше десяти процентов, если за него придётся платить месяцем ожидания и риском смешать эффект с сезонностью.
Обратите внимание, насколько резко меняется цена: разница между +5% и +10% — это разница между тридцатью тремя днями и девятью. Ровно в этом и состоит квадратичная зависимость, о которой легко забыть, пока не подставишь свои числа.
Обратите внимание на порядок действий: сначала решение о внедрении, потом MDE, и только потом калькулятор. Если начать с калькулятора и подбирать эффект под приемлемый срок, получится обоснование задним числом, а не планирование.
Частые вопросы
Можно ли добрать трафика, если тест не сошёлся? Можно, но решение о продлении должно быть принято до того, как вы посмотрели на результат. Иначе это то же подглядывание: продлевают обычно те тесты, где результат почти дотянул, и это смещает итог в сторону желаемого.
Считать выборку на группу или всего? Формула даёт число на одну группу. При двух группах общий трафик вдвое больше, при трёх — втрое, и срок растёт соответственно.
Что если конверсия в контроле неизвестна? Возьмите оценку по историческим данным за период, сопоставимый с будущим тестом. Ошибка в базовой конверсии влияет на ответ слабее, чем ошибка в MDE: удвоение MDE меняет выборку вчетверо, а сдвиг базы с 5% на 6% — примерно на пятую часть.
Нужен ли односторонний критерий? Он требует меньшей выборки, и именно поэтому к нему тянутся. Но он обязывает заранее согласиться не замечать ухудшение — а ухудшение как раз то, ради чего эксперименты и ставят.
Считается ли период прогрева? Первые дни после запуска часто ведут себя иначе: кеши, постепенная раскатка, эффект новизны. Эти дни лучше не включать в выборку, а срок планировать с запасом на них.
Что делать, если трафика не хватает
Пересмотреть MDE. Часто выясняется, что +3% никто и не собирался внедрять — команде интересен прирост от +10%. Это сразу сокращает срок в разы.
Сменить метрику на более частую. Конверсия в оплату редкая; конверсия в начало оформления случается на порядок чаще, и на ней тест сходится быстрее. Условие одно: связь между этой метрикой и деньгами должна быть проверена заранее, иначе вы ускорите получение бесполезного ответа.
Убрать лишние варианты. Три группы вместо двух — это не только деление трафика, но и дополнительные сравнения, каждое со своим шансом на случайную находку.
Признать, что тест не подходит. Не всё измеряется A/B-тестом: редкие события, длинный цикл принятия решения, сетевые эффекты. Иногда честнее выкатить изменение и следить за guardrail-метриками.
Объединить варианты. Три версии кнопки — это три сравнения и втрое меньше трафика на каждое. Если различия между ними мелкие, дешевле выбрать одну по качественным соображениям и проверять её против контроля.
И отдельно про то, чего делать не стоит: занижать мощность, чтобы уложиться в срок. Мощность 50% означает, что реальный эффект нужного размера тест пропустит в половине случаев — такой эксперимент не столько измеряет, сколько бросает монету, но с видимостью строгости.
Материалы по теме

Статистическая мощность: почему тест не находит эффект, который есть
Что такое мощность A/B-теста, как она связана с размером выборки и MDE, как посчитать нужное число участников и почему «незначимо» на слабом тесте ничего не доказывает.

MDE и размер выборки: как понять, хватит ли данных для A/B-теста
Что такое MDE, как он связан с размером выборки и длительностью эксперимента, почему маленький тест не может доказать большой продуктовый вывод.
Калькулятор значимости A/B-теста: как посчитать и как прочитать результат
Как посчитать статистическую значимость A/B-теста по двум конверсиям: какие числа нужны, что означает p-value и доверительный интервал разницы, и когда расчёт вообще не применим.