Калькулятор A/B-теста

Сравните конверсию контроля и вариантов теста — доверительный интервал и статистическая значимость разницы.

Количество вариантов
2
Достоверность95%
A
10.0%
8.3%12.0%
B
13.0%
11.1%15.2%

Вывод: Вариант B лучше варианта A — конверсия выше на 30%

Калькулятор A/B-теста: поля конверсии контроля и варианта, доверительный интервал и значимость разницы
Калькулятор A/B-теста считает, значима ли разница в конверсии или это случайность выборки

13% против 10% ещё не победа

Конверсия — это оценка по конкретной выборке, а не точное свойство варианта. Соберите ту же тысячу посетителей ещё раз, и цифра слегка сдвинется. Доверительный интервал показывает, в каком диапазоне на самом деле лежит истинная конверсия. Значимость отвечает на другой вопрос: могла ли разница между вариантами получиться просто из-за случайности выборки.

Ширина интервала зависит от выбранного уровня доверия. За ним стоит критическое значение z, и чем выше уверенность, тем шире интервал:

Уровень доверияЗначение zЧто означает
80%1,282грубая прикидка, ошибётесь в каждом пятом случае
90%1,645мягкий порог для быстрых решений
95%1,960стандарт по умолчанию в продуктовой аналитике
99%2,576когда цена ошибки высока

Повысить уровень доверия и не потерять в чувствительности можно только одним способом: набрать больше наблюдений.

Почему интервал Уилсона, а не «плюс-минус» на глаз

Обычное нормальное приближение (среднее ± z·стандартная ошибка) на низкой конверсии или маленькой выборке легко даёт нижнюю границу ниже нуля. Формула просто не знает, что доля не может выйти за эти пределы. Интервал Уилсона устроен иначе и всегда остаётся в границах 0–100%.

Разница между вариантами считается отдельно, двухвыборочным z-тестом пропорций. Это тот же метод, что и хи-квадрат тест, на котором построены большинство калькуляторов A/B-тестов, включая калькулятор Эвана Миллера. При трёх и более вариантах калькулятор сравнивает их попарно и поднимает порог значимости поправкой Бонферрони. Чем больше пар проверяется, тем выше шанс найти «значимую» разницу просто по случайности, если не ужесточить критерий.

Маленькая выборка обманывает чаще, чем кажется

Один и тот же прирост конверсии на 100 посетителях и на 10 000 значит разное. На маленькой выборке доверительный интервал широкий, и то, что выглядит как явная победа варианта, легко оказывается шумом. Останавливать тест по первому «значимому» результату не стоит. Дождитесь, пока выборка наберёт объём, достаточный для выбранного уровня доверия.

Похожие инструменты

Другие полезные инструменты из той же категории

Часто задаваемые вопросы

По формуле Уилсона — в отличие от простого нормального приближения она не даёт отрицательную нижнюю границу или границу выше 100% на маленькой выборке или низкой конверсии, что для веба обычное дело.

Что разница между конверсией варианта и контроля вряд ли объясняется случайностью выборки — вероятность случайного совпадения (p-value) ниже выбранного порога. Это не гарантия, что вариант лучше в будущем, а оценка на основе собранных данных.

Чем меньше посетителей, тем шире доверительный интервал и тем больше шанс, что наблюдаемая разница — просто шум выборки. Тот же прирост в процентах на 100 посетителях и на 10 000 даёт разную уверенность в результате.

До 8 — калькулятор сравнивает их все попарно, а не только каждый с первым, и поднимает порог значимости поправкой Бонферрони: чем больше пар, тем строже критерий, иначе с ростом числа сравнений растёт и шанс случайно найти «значимую» разницу там, где её нет.