# Стратегии остановки A/B теста
Стратегия остановки определяет, когда A/B тест можно считать завершённым и какой вариант признать победителем — или честно сказать, что значимой разницы нет.
# Стратегии остановки
# 1. Байесовский анализ (по умолчанию, рекомендуется)
Система строит апостериорные распределения конверсии для каждого варианта (Beta-Binomial) и оценивает вероятность того, что один вариант лучше другого. Тест останавливается, когда эта вероятность превышает заданный порог.
Параметры:
| Параметр | Описание | По умолчанию |
|---|---|---|
| Порог вероятности победы | Насколько уверенным должно быть утверждение «вариант лучше», чтобы остановить тест. 95% — баланс между скоростью и надёжностью; 99% — максимально строго; 90% — быстрее, но выше риск ложного победителя | 95% |
| Максимальная длительность | Жёсткий дедлайн: даже если вероятность не достигла порога, тест остановится по истечении срока. В этом случае значимой разницы не найдено | 90 дней |
Как это выглядит пользователю: «С вероятностью 96% вариант B лучше контроля» — это интуитивно понятный бизнес-вывод, без p-value и без разговоров про alpha.
Когда использовать:
- Для большинства продуктовых экспериментов
- Когда важна интерпретируемость результата для нетехнической команды
- Когда допустимо остановиться чуть раньше ради скорости принятия решения
Особенность: даже если срок вышел, а значимой разницы нет — это тоже честный результат. Байес прямо скажет «разница в пределах шума», и карточка теста покажет именно это, а не ложное «значимо».
# 2. Ручная остановка
Тест работает бессрочно — вы останавливаете его вручную, когда сочтёте результат достаточным. Никаких автоматических остановок нет. Карточка теста в этом режиме показывает оценку значимости как ориентировочную (с пометкой «Оценка»), потому что стратегия не принимает решения об остановке — это всегда ваш шаг.
Когда использовать:
- Вы хотите полного контроля
- Нет чёткого ожидания по эффекту
Как остановить: смените статус теста на «Остановлен» в настройках или на странице управления.
# 3. По объёму выборки (Fixed Sample Size)
Система рассчитывает необходимый объём выборки на основе ожидаемого эффекта и уровня значимости. Тест автоматически останавливается, когда:
- Каждый вариант набрал рассчитанное количество сессий И
- Прошло не менее минимального количества дней
Параметры:
| Параметр | Описание | По умолчанию |
|---|---|---|
| Ожидаемый прирост конверсии (MDE) | Минимальный относительный прирост, который хотим обнаружить. Например, MDE=10% при базовой конверсии 2% — мы заметим разницу, если тестовый вариант конвертирует в 2,2% и выше | — (обязательный) |
| Минимальная длительность | Минимальное количество дней теста, даже если нужный объём набран раньше. Защита от bias выходного/будних дней | 7 дней |
Как работает расчёт:
Используется формула two-proportion z-test с мощностью 80%:
- При ожидаемом приросте 10% и базовой конверсии 2% система рассчитает примерно 6 000 сессий на каждый вариант
- При приросте 5% — уже ~24 000 сессий
- Чем меньше ожидаемый прирост, тем больше нужно данных
Прогресс отображается в процентах — показывает, что меньше продвинулось: набор выборки или минимальная длительность.
Важно про результат: эта стратегия не проверяет значимость в процессе — она просто ждёт заранее рассчитанный объём. После остановки система отдельным z-тестом определяет, есть ли статистически значимая разница. Если её нет (типичный случай для АА-теста или слабого эффекта) — вы увидите честное «тест завершён, значимых различий не обнаружено», а не ложного победителя.
Когда использовать:
- Есть гипотеза о конкретном ожидаемом приросте
- Важна статистическая строгость и предсказуемость срока
- Не критично потратить немного больше времени ради надёжного результата
# 4. Последовательное тестирование (Sequential)
Система делает промежуточные проверки по расписанию и может остановить тест досрочно, если разница между вариантами стала статистически значимой. Используется метод O'Brien-Fleming.
Параметры:
| Параметр | Описание | По умолчанию |
|---|---|---|
| Максимальная длительность | Жёсткий дедлайн: тест остановится по истечении этого срока в любом случае | 90 дней |
| Интервал проверок | Как часто проводить промежуточный анализ | 7 дней |
Как работает:
- Число промежуточных анализов =
MaxDurationDays / CheckIntervalDays(минимум 2) - На каждой проверке рассчитывается Z-статистика и сравнивается с критической границей O'Brien-Fleming
- Граница на ранних проверках строже — это защита от «заглядывания в данные» (peeking problem)
- Если значимость достигнута — тест останавливается досрочно, победитель объявляется с пометкой «по значимости»
- Если нет — тест продолжается до следующей проверки
- По истечении максимальной длительности тест останавливается принудительно, и если значимой разницы за всё время не нашлось — результат будет «в пределах шума», а не «победитель»
Минимальные требования для промежуточного анализа: не менее 50 сессий и 5 конверсий в каждом варианте.
Когда использовать:
- Хотите возможность досрочной остановки при явном победителе
- Тест планируется на долгий срок (30–90 дней)
- Важно минимизировать время до решения
# Поправка множественных сравнений
Доступна для частотных стратегий — по объёму выборки и последовательной. Байесовская и ручная её не используют.
Когда в тесте несколько вариантов и вы сравниваете лидера с контролем (или варианты между собой), одновременно проверяется сразу несколько гипотез. Чем больше сравнений — тем выше шанс, что хотя бы одно окажется «значимым» просто случайно. Поправка ужесточает порог значимости, чтобы удержать общий риск ложного победителя.
| Режим | Как работает | Когда выбирать |
|---|---|---|
| Бонферрони (по умолчанию) | Делит уровень значимости на число сравнений. Самый консервативный вариант | По умолчанию; когда важна максимальная защита от случайного победителя |
| Шидак | Чуть мягче Бонферрони, рассчитан на независимые сравнения. Практический выигрыш в скорости небольшой | Когда сравнения близки к независимым и хочется чуть быстрее |
| Без поправки | Порог не ужесточается | Только осознанно: при нескольких вариантах растёт риск ложного победителя |
Сколько сравнений считается — зависит от режима сравнения:
- «Лидер против контроля» и «лидер против всех остальных» — сравнений столько же, сколько активных вариантов;
- «Лидер против второго места» — сравниваются все пары вариантов;
- «Контроль против объединённого теста» — сравнение всего одно, и поправка ни на что не влияет. В этом случае поле поправки в редакторе заблокировано с пояснением.
Рядом с полем редактор показывает фактический эффект: например, «Сравнений: 16 · уровень значимости на сравнение 0,31% вместо 5%» — видно, насколько строже стал порог.
Для старых тестов, созданных до появления этой настройки, применяется Бонферрони — это совпадает с прежним поведением.
# Сравнительная таблица
| Байесовская | По объёму выборки | Последовательная | Ручная | |
|---|---|---|---|---|
| Автоостановка | При достижении порога вероятности | По достижении нужного объёма | При достижении значимости или дедлайне | Нет |
| Параметры | Порог вероятности, макс. длительность | Ожидаемый прирост (MDE), мин. длительность | Макс. длительность, интервал проверок | — |
| Возможность досрочной остановки | Нет (ждёт порога) | Нет | Да, при значимости | Только вручную |
| Что говорит при отсутствии разницы | «Разница в пределах шума» | «Тест завершён, значимых различий не обнаружено» | «Срок вышел, разницы нет» | Зависит от вашей оценки |
| Когда подходит | Большинство продуктовых тестов | Чёткая гипотеза, важна строгость | Долгие тесты, хочется ускорить | Полный контроль |