Инструменты

Размер выборки для A/B-теста

Сколько наблюдений нужно набрать и сколько это займёт дней, чтобы тест смог заметить эффект нужного размера. И почему вдвое меньший эффект стоит вчетверо большего трафика.

две доли, двусторонний критерий · считается в браузере

Тест увидит рост с 5,00% до 5,50% — это 0,50 п.п.

Уровень доверия
Мощность

Нужно 31 234 наблюдения на каждую группу, это 32 дня при таком трафике.

На группу
31 234
Всего
62 468
Длительность
32 дня
Как размер выборки зависит от эффекта
1,3%эффект, % относительно базы30%

Вдвое меньший эффект стоит примерно вчетверо большей выборки

Больше четырёх недель. За такой срок успевают смениться сезон, состав трафика и сам продукт, и разница между группами перестаёт объясняться одним изменением. Обычно дешевле пересмотреть эффект, который вы согласны не заметить, чем ждать.

Как это считается

Размер выборки отвечает на вопрос, обратный к значимости. Значимость смотрит на уже собранные данные, а здесь мы заранее решаем, какой эффект тест обязан заметить, — и выясняем, сколько для этого нужно наблюдений.

Этот эффект называют MDE, минимальным детектируемым эффектом. Его выбирают не из статистики, а из бизнеса: какой прирост окупает разработку и внедрение. Тест меньшего эффекта не увидит — и это нормально, если такой прирост всё равно не окупился бы.

Мощность — вероятность заметить эффект, если он на самом деле есть. Восемьдесят процентов означают, что в одном случае из пяти реально существующий прирост тест пропустит. Это стандартный, а не безопасный выбор: цена пропуска здесь молчаливая, и её редко считают.

Размер выборки растёт как квадрат обратного эффекта. Поэтому вдвое меньший MDE стоит не вдвое, а вчетверо большего трафика, и кривая рядом с ответом показывает это лучше любой формулы. Обычно из неё следует не «набрать больше», а «пересмотреть, какой прирост мы согласны не заметить».

Формула считает объединённую дисперсию под гипотезой «разницы нет» и раздельную под альтернативой — ровно так, как потом будет считать критерий значимости. Планировать выборку по одной формуле, а проверять результат по другой значит получить два разных ответа на один вопрос.

Критерий двусторонний: он ловит и рост, и падение. Односторонний требует меньшей выборки, и именно поэтому к нему тянутся — но он обязывает заранее отказаться замечать ухудшение, а это редко то, чего на самом деле хотят.

Разбор в статьеMDE и размер выборки: сколько трафика нужно A/B-тесту