# Стратегии остановки A/B теста

Стратегия остановки определяет, когда A/B тест можно считать завершённым и какой вариант признать победителем — или честно сказать, что значимой разницы нет.


# Стратегии остановки

# 1. Байесовский анализ (по умолчанию, рекомендуется)

Система строит апостериорные распределения конверсии для каждого варианта (Beta-Binomial) и оценивает вероятность того, что один вариант лучше другого. Тест останавливается, когда эта вероятность превышает заданный порог.

Параметры:

Параметр Описание По умолчанию
Порог вероятности победы Насколько уверенным должно быть утверждение «вариант лучше», чтобы остановить тест. 95% — баланс между скоростью и надёжностью; 99% — максимально строго; 90% — быстрее, но выше риск ложного победителя 95%
Максимальная длительность Жёсткий дедлайн: даже если вероятность не достигла порога, тест остановится по истечении срока. В этом случае значимой разницы не найдено 90 дней

Как это выглядит пользователю: «С вероятностью 96% вариант B лучше контроля» — это интуитивно понятный бизнес-вывод, без p-value и без разговоров про alpha.

Когда использовать:

  • Для большинства продуктовых экспериментов
  • Когда важна интерпретируемость результата для нетехнической команды
  • Когда допустимо остановиться чуть раньше ради скорости принятия решения

Особенность: даже если срок вышел, а значимой разницы нет — это тоже честный результат. Байес прямо скажет «разница в пределах шума», и карточка теста покажет именно это, а не ложное «значимо».


# 2. Ручная остановка

Тест работает бессрочно — вы останавливаете его вручную, когда сочтёте результат достаточным. Никаких автоматических остановок нет. Карточка теста в этом режиме показывает оценку значимости как ориентировочную (с пометкой «Оценка»), потому что стратегия не принимает решения об остановке — это всегда ваш шаг.

Когда использовать:

  • Вы хотите полного контроля
  • Нет чёткого ожидания по эффекту

Как остановить: смените статус теста на «Остановлен» в настройках или на странице управления.


# 3. По объёму выборки (Fixed Sample Size)

Система рассчитывает необходимый объём выборки на основе ожидаемого эффекта и уровня значимости. Тест автоматически останавливается, когда:

  • Каждый вариант набрал рассчитанное количество сессий И
  • Прошло не менее минимального количества дней

Параметры:

Параметр Описание По умолчанию
Ожидаемый прирост конверсии (MDE) Минимальный относительный прирост, который хотим обнаружить. Например, MDE=10% при базовой конверсии 2% — мы заметим разницу, если тестовый вариант конвертирует в 2,2% и выше — (обязательный)
Минимальная длительность Минимальное количество дней теста, даже если нужный объём набран раньше. Защита от bias выходного/будних дней 7 дней

Как работает расчёт:

Используется формула two-proportion z-test с мощностью 80%:

  • При ожидаемом приросте 10% и базовой конверсии 2% система рассчитает примерно 6 000 сессий на каждый вариант
  • При приросте 5% — уже ~24 000 сессий
  • Чем меньше ожидаемый прирост, тем больше нужно данных

Прогресс отображается в процентах — показывает, что меньше продвинулось: набор выборки или минимальная длительность.

Важно про результат: эта стратегия не проверяет значимость в процессе — она просто ждёт заранее рассчитанный объём. После остановки система отдельным z-тестом определяет, есть ли статистически значимая разница. Если её нет (типичный случай для АА-теста или слабого эффекта) — вы увидите честное «тест завершён, значимых различий не обнаружено», а не ложного победителя.

Когда использовать:

  • Есть гипотеза о конкретном ожидаемом приросте
  • Важна статистическая строгость и предсказуемость срока
  • Не критично потратить немного больше времени ради надёжного результата

# 4. Последовательное тестирование (Sequential)

Система делает промежуточные проверки по расписанию и может остановить тест досрочно, если разница между вариантами стала статистически значимой. Используется метод O'Brien-Fleming.

Параметры:

Параметр Описание По умолчанию
Максимальная длительность Жёсткий дедлайн: тест остановится по истечении этого срока в любом случае 90 дней
Интервал проверок Как часто проводить промежуточный анализ 7 дней

Как работает:

  • Число промежуточных анализов = MaxDurationDays / CheckIntervalDays (минимум 2)
  • На каждой проверке рассчитывается Z-статистика и сравнивается с критической границей O'Brien-Fleming
  • Граница на ранних проверках строже — это защита от «заглядывания в данные» (peeking problem)
  • Если значимость достигнута — тест останавливается досрочно, победитель объявляется с пометкой «по значимости»
  • Если нет — тест продолжается до следующей проверки
  • По истечении максимальной длительности тест останавливается принудительно, и если значимой разницы за всё время не нашлось — результат будет «в пределах шума», а не «победитель»

Минимальные требования для промежуточного анализа: не менее 50 сессий и 5 конверсий в каждом варианте.

Когда использовать:

  • Хотите возможность досрочной остановки при явном победителе
  • Тест планируется на долгий срок (30–90 дней)
  • Важно минимизировать время до решения

# Поправка множественных сравнений

Доступна для частотных стратегий — по объёму выборки и последовательной. Байесовская и ручная её не используют.

Когда в тесте несколько вариантов и вы сравниваете лидера с контролем (или варианты между собой), одновременно проверяется сразу несколько гипотез. Чем больше сравнений — тем выше шанс, что хотя бы одно окажется «значимым» просто случайно. Поправка ужесточает порог значимости, чтобы удержать общий риск ложного победителя.

Режим Как работает Когда выбирать
Бонферрони (по умолчанию) Делит уровень значимости на число сравнений. Самый консервативный вариант По умолчанию; когда важна максимальная защита от случайного победителя
Шидак Чуть мягче Бонферрони, рассчитан на независимые сравнения. Практический выигрыш в скорости небольшой Когда сравнения близки к независимым и хочется чуть быстрее
Без поправки Порог не ужесточается Только осознанно: при нескольких вариантах растёт риск ложного победителя

Сколько сравнений считается — зависит от режима сравнения:

  • «Лидер против контроля» и «лидер против всех остальных» — сравнений столько же, сколько активных вариантов;
  • «Лидер против второго места» — сравниваются все пары вариантов;
  • «Контроль против объединённого теста» — сравнение всего одно, и поправка ни на что не влияет. В этом случае поле поправки в редакторе заблокировано с пояснением.

Рядом с полем редактор показывает фактический эффект: например, «Сравнений: 16 · уровень значимости на сравнение 0,31% вместо 5%» — видно, насколько строже стал порог.

Для старых тестов, созданных до появления этой настройки, применяется Бонферрони — это совпадает с прежним поведением.


# Сравнительная таблица

Байесовская По объёму выборки Последовательная Ручная
Автоостановка При достижении порога вероятности По достижении нужного объёма При достижении значимости или дедлайне Нет
Параметры Порог вероятности, макс. длительность Ожидаемый прирост (MDE), мин. длительность Макс. длительность, интервал проверок
Возможность досрочной остановки Нет (ждёт порога) Нет Да, при значимости Только вручную
Что говорит при отсутствии разницы «Разница в пределах шума» «Тест завершён, значимых различий не обнаружено» «Срок вышел, разницы нет» Зависит от вашей оценки
Когда подходит Большинство продуктовых тестов Чёткая гипотеза, важна строгость Долгие тесты, хочется ускорить Полный контроль

# Следующие шаги