Доверительный интервал: как показать, насколько точна ваша цифра
Что означает 95% доверительный интервал для конверсии и разницы конверсий, как его посчитать, почему он важнее p-value и какая формулировка про него неверна.
Содержание статьи
Конверсия 21% выглядит как факт. На деле это оценка по выборке, и следующая тысяча пользователей даст другое число. Доверительный интервал — способ показать, насколько велика эта неопределённость, одной короткой записью. Он полезнее p-value почти во всех продуктовых разговорах, потому что говорит на языке эффекта, а не на языке гипотез.
Коротко
Интервал отвечает на вопрос «в каких пределах правдоподобно лежит настоящее значение», а не «есть ли эффект».
- Ширина интервала показывает, сколько данных вы собрали: чем больше выборка, тем он уже.
- Интервал разницы, который целиком выше нуля, означает то же, что p < 0,05, но говорит ещё и о размере.
- Формулировка «настоящее значение лежит здесь с вероятностью 95%» строго говоря неверна — правильная в тексте ниже.
- Узкий интервал вокруг нуля — содержательный результат: крупного эффекта нет.
- Широкий интервал — это не «нет эффекта», а «данных не хватило».
Что означает «95%»
Строгое определение звучит непривычно: если повторить эксперимент много раз и каждый раз строить интервал одним и тем же способом, примерно 95% таких интервалов накроют настоящее значение. Проценты относятся к процедуре построения, а не к конкретному отрезку на экране.
Поэтому фраза «с вероятностью 95% конверсия лежит между 17,4% и 24,6%» формально неверна: настоящее значение — не случайная величина, оно либо внутри, либо снаружи. Случаен интервал, а не истина.
В рабочем разговоре достаточно менее строгой, но честной формулировки: «данные совместимы со значениями от 17,4% до 24,6%». Она не создаёт ложного ощущения, что мы измерили вероятность истины, и при этом говорит ровно то, что нужно для решения.
p ± z · √( p(1−p) / n )z = 1,96 для 95%. Формула перестаёт работать при очень малых выборках и долях у краёв.
Считаем на живых числах
Возьмём эксперимент из финальной главы SQL-курса. В контроле 105 активаций из 500 участников, в тестовой группе — 135 из 500.
Для контроля: доля 21%, стандартная ошибка √(0,21 · 0,79 / 500) ≈ 1,8 п.п., интервал от 17,4% до 24,6%. Для теста: 27% и интервал от 23,1% до 30,9%. Уже здесь видно, насколько грубыми были бы выводы по одним точечным значениям: две оценки различаются на 6 пунктов, а их интервалы почти касаются друг друга.
И главная ошибка чтения: пересечение интервалов двух групп не означает отсутствия разницы. Сравнивать нужно не два интервала, а интервал самой разницы — он считается отдельно и получается уже, чем кажется по картинке.
| Величина | Оценка | 95% интервал |
|---|---|---|
| Конверсия контроля | 21,0% | от 17,4% до 24,6% |
| Конверсия теста | 27,0% | от 23,1% до 30,9% |
| Разница | +6,0 п.п. | от +0,7 до +11,3 п.п. |
Читаем интервал разницы
Интервал разницы — от +0,7 до +11,3 процентного пункта — и есть тот объект, по которому принимают решение. Он целиком выше нуля, поэтому результат «значим»; но его ширина говорит гораздо больше, чем этот факт.
Нижняя граница отвечает на вопрос «а если нам не повезло»: даже в пессимистичном случае прирост около 0,7 пункта. Верхняя показывает потолок оптимизма. Дальше это сравнивают с порогом окупаемости, который назначают до эксперимента: если изменение окупается начиная с +2 п.п., данные его не гарантируют, и осторожная раскатка выглядит разумнее полной.
Обратная ситуация встречается чаще, чем кажется: интервал от −0,4 до +0,6 п.п. Формально «незначимо», но по смыслу это сильный результат — он исключает и заметный рост, и заметное падение. Такую гипотезу можно закрывать со спокойной совестью, чего нельзя сделать по одному p-value.
Нижняя и верхняя границы 95% интервала разницы конверсий и наблюдаемая оценка между ними.
Что делает интервал шире
Ширина зависит от трёх вещей, и все три полезно понимать до сбора данных.
Размер выборки: интервал сужается пропорционально корню из числа наблюдений. Чтобы сделать его вдвое уже, данных нужно вчетверо больше — поэтому «добрать ещё немного» редко помогает.
Разброс самой величины: у долей он максимален около 50% и падает у краёв, у средних зависит от дисперсии. Метрика с длинным хвостом — выручка на пользователя, длительность сессии — даёт куда более широкий интервал, чем конверсия при том же числе наблюдений.
Выбранный уровень уверенности: интервал на 99% шире, чем на 95%. Это не «точнее», а осторожнее: вы соглашаетесь на менее конкретное утверждение ради меньшего риска промахнуться.
Сколько данных нужно, чтобы интервал стал полезным
Пока интервал шире, чем цена решения, эксперимент не отвечает на вопрос. Полезно посчитать заранее, при каком объёме он станет достаточно узким.
Для нашей разницы в 6 пунктов картина такая. На сотне участников в группе интервал идёт от −5,8 до +17,8 п.п. — он включает и заметное падение, и двузначный рост, то есть не исключает почти ничего. На пятистах сужается до +0,7…+11,3. На двух тысячах — до +3,4…+8,6, и здесь уже можно осмысленно спорить о порогах окупаемости. На восьми тысячах — +4,7…+7,3.
Обратите внимание на темп: увеличение выборки вчетверо сужает интервал вдвое. Это тот самый корень, из-за которого «подождём ещё пару дней» обычно не спасает почти ничего, а планировать объём нужно до старта.
| Участников в группе | Полуширина интервала | Интервал разницы |
|---|---|---|
| 100 | ±11,8 п.п. | от −5,8 до +17,8 п.п. |
| 500 | ±5,3 п.п. | от +0,7 до +11,3 п.п. |
| 2000 | ±2,6 п.п. | от +3,4 до +8,6 п.п. |
| 8000 | ±1,3 п.п. | от +4,7 до +7,3 п.п. |
Средние и деньги считаются иначе
Для конверсии формула проста, потому что доля устроена предсказуемо. С выручкой на пользователя, длительностью сессии или числом действий всё сложнее: у таких величин длинный правый хвост, и несколько крупных значений двигают среднее сильнее, чем вся остальная масса.
Практический признак проблемы — интервал, который заметно меняется при удалении одного-двух пользователей. Если такое возможно, среднее плохо описывает выборку, и стоит либо перейти к более устойчивой величине (медиана, усечённое среднее), либо строить интервал через bootstrap: многократно пересобирать выборку с возвращением и смотреть, как гуляет оценка.
Bootstrap хорош тем, что не требует предположений о форме распределения и одинаково работает для среднего, медианы, доли и почти любой производной метрики. Цена — вычисления вместо формулы, но на продуктовых объёмах это секунды.
Где формула ломается
Обычная формула через нормальное приближение хорошо работает в середине, но плохо у краёв. Если конверсия 1% и наблюдений мало, интервал может уйти в отрицательные значения — величина, невозможная физически. Для таких случаев берут интервалы Уилсона или Клоппера — Пирсона, они устроены иначе и не выходят за пределы.
Отдельная тонкость — зависимые наблюдения. Формула предполагает, что наблюдения независимы. Если один пользователь дал десять сессий, а вы считаете сессии, интервал получится уже настоящего: вы посчитали десять наблюдений там, где независимых источников информации было меньше.
И общий предел: интервал описывает только случайную ошибку выборки. Систематические искажения — сломанный трекинг, перекос групп, самоотбор аудитории — он не видит и не лечит. Аккуратный интервал вокруг смещённой оценки остаётся смещённой оценкой.
- Малая выборка или доля у края — считать по Уилсону, а не по нормальному приближению.
- Единица наблюдения должна совпадать с единицей рандомизации.
- Метрики с длинным хвостом требуют bootstrap или устойчивых оценок.
- Интервал не защищает от смещения — только от случайного шума.
Как показывать интервал в отчёте
Простое правило: любое число, полученное по выборке, выходит из отчёта вместе с интервалом. Одна строка вместо одного числа — «27% (23,1–30,9%)» — снимает половину вопросов на встрече и предотвращает основную ошибку продуктового чтения: восприятие оценки как точной величины.
На графиках интервал показывают полосой или усами. Это особенно важно для рядов по дням и для разрезов: без них любая мелкая рябь читается как тренд, а сегмент из тридцати человек выглядит равноправным с сегментом из трёх тысяч.
В тексте решения интервал стоит переводить в бизнес-единицы: не «от +0,7 до +11,3 п.п.», а «от 30 до 500 дополнительных активаций в неделю при нынешнем трафике». Тогда разговор о том, окупается ли изменение, ведётся на языке, где у людей есть интуиция.
Материалы по теме

p-value простыми словами: что он показывает и чего не доказывает
Что на самом деле измеряет p-value, почему 0,05 — не граница истины, как читать его вместе с доверительным интервалом и что делать, когда результат «незначим».

Статистическая значимость в A/B-тесте: p-value и доверительный интервал
Объясняем статистическую значимость без магии: как читать p-value, доверительный интервал и разницу между “значимо” и “полезно для бизнеса”.

MDE и размер выборки: как понять, хватит ли данных для A/B-теста
Что такое MDE, как он связан с размером выборки и длительностью эксперимента, почему маленький тест не может доказать большой продуктовый вывод.