Вывод: Вариант B лучше варианта A — конверсия выше на 30%
13% против 10% — это ещё не победа
Конверсия — это оценка по конкретной выборке, а не точное свойство варианта. Соберите ту же тысячу посетителей ещё раз, и цифра слегка сдвинется. Доверительный интервал показывает, в каком диапазоне на самом деле лежит истинная конверсия. Значимость отвечает на другой вопрос: могла ли разница между вариантами получиться просто из-за случайности выборки.
Почему интервал Уилсона, а не «плюс-минус» на глаз
Обычное нормальное приближение (среднее ± z·стандартная ошибка) на низкой конверсии или маленькой выборке легко даёт нижнюю границу ниже нуля — формула просто не знает, что доля не может выйти за эти пределы. Интервал Уилсона устроен иначе и всегда остаётся в границах 0–100%.
Разница между вариантами считается отдельно, двухвыборочным z-тестом пропорций — тем же методом, что и хи-квадрат тест, на котором построены большинство калькуляторов A/B-тестов, включая калькулятор Эвана Миллера. При трёх и более вариантах калькулятор сравнивает их попарно и поднимает порог значимости поправкой Бонферрони: чем больше пар проверяется, тем выше шанс найти «значимую» разницу просто по случайности, если не ужесточить критерий.
Маленькая выборка обманывает чаще, чем кажется
Один и тот же прирост конверсии на 100 посетителях и на 10 000 значит разное. На маленькой выборке доверительный интервал широкий, и то, что выглядит как явная победа варианта, легко оказывается шумом. Останавливать тест по первому «значимому» результату не стоит — лучше дождаться, пока выборка наберёт объём, достаточный для выбранного уровня доверия.