Калькулятор z-оценки
Насколько необычно значение: на сколько стандартных отклонений оно отходит от среднего и какой это перцентиль. Или вставьте ряд — и увидите, какие значения выбиваются.
Считает z-оценку, перцентиль и выбросы в ряду прямо в браузере.
Значение на 2,00 стандартного отклонения выше среднего. Для нормальных данных это необычно: дальше двух σ уходит около 5% наблюдений.
- +2,00
- 97,7%
- 4,55%
Перцентиль и доли посчитаны для нормального распределения. У скошенных данных — платежей, времени на сайте, числа заказов — та же z-оценка означает другую долю, и пересчёт в перцентиль неверен.
Как это считается
Z-оценка — это расстояние от среднего, измеренное в стандартных отклонениях: z = (x − μ) / σ. Знак показывает сторону, модуль — насколько далеко. Значение 130 при среднем 100 и σ = 15 даёт z = +2: на два отклонения выше среднего.
Перцентиль получается из z через функцию нормального распределения Φ(z). При z = +2 это 97,7%: столько значений нормального распределения лежит ниже. Перевод верен только для данных, похожих на нормальные. У платежей, длительности сессий и числа заказов длинный правый хвост, и та же z-оценка там соответствует другой доле.
В режиме «Ряд чисел» среднее и выборочное стандартное отклонение (с делителем n − 1) считаются из тех же значений, а затем для каждого находится z. Порог 2 ловит примерно каждое двадцатое значение нормального ряда, порог 3 — меньше трёх из тысячи. Какой выбрать, зависит от цены ошибки: пропустить аномалию или зря поднять тревогу.
У этого способа есть слабое место. Сильный выброс сам сдвигает среднее и раздувает σ, и соседние странные значения рядом с ним перестают выделяться. Поэтому рядом показана медиана: если она заметно отстоит от среднего, ряд скошен или засорён, и надёжнее модифицированная z-оценка через медиану и MAD — она разобрана в статье.
Z-статистика в A/B-тесте устроена так же, только делят разницу между группами на её стандартную ошибку. Для этого случая есть отдельный калькулятор значимости.