A/B-тесты рассылок: как получить результат, которому можно верить
Сплит-тест — единственный способ узнать, что работает на вашей базе, а не на чьей-то чужой. И самый простой способ обмануть себя, если считать победителем того, у кого процент выше.
Как устроен тест
Базу делят случайно на группы, каждой отправляют свой вариант письма, ждут заданное время и сравнивают. Дальше — либо тест шёл на всей базе, и вы просто узнали что-то на будущее, либо тестовой группой была её часть, и победивший вариант автоматически уходит остальным.
Классическая пропорция: 20–30% базы уходит в тест, остальные получают победителя. Но эти проценты — не правило, а следствие арифметики: сколько нужно людей, чтобы разница вообще стала различима. Ниже как раз об этом.
Что тестировать
| Элемент | На что влияет | Замечание |
|---|---|---|
| Тема письма | открытия | Самый частый и самый быстрый тест. Длина, вопрос против утверждения, цифра в теме, эмодзи. |
| Прехедер | открытия | Работает в паре с темой: в списке писем их читают вместе. |
| Имя отправителя | открытия, жалобы | «Компания» против «Имя из компании». Влияет и на узнаваемость — менять часто нельзя. |
| Содержание, кнопка, оффер | клики | Требует заметно большей выборки, чем тест темы: кликов всегда в разы меньше открытий. |
| Время отправки | открытия | Особый случай: результат — рекомендация на будущее, а не выбор письма для остатка базы. Требует повторов, чтобы отделить день недели от часа. |
Меняйте одно за раз. Если у варианта B другая тема и другая картинка, победа B не скажет, что именно сработало, — и перенести вывод на следующие рассылки будет некуда.
Главная ошибка: сравнивать проценты
Открытия и клики — случайные события. Возьмите два полностью одинаковых письма, разошлите их двум случайным половинам базы — доли почти никогда не совпадут. У одной будет 3,4%, у другой 3,8%. Разница есть, победителя нет.
Поэтому вопрос не «у кого процент выше», а «переживёт ли это расхождение повтор». Ответ на него даёт статистическая проверка: она считает, насколько вероятно увидеть такую разницу, если письма на самом деле одинаковы. Если вероятность мала — разница настоящая.
Практическое следствие важнее формулы: маленькая выборка не «менее точна» — она вводит в заблуждение. Она регулярно выдаёт красивых победителей, которых нет, и вы переносите выдуманное правило на все следующие рассылки.
Сколько получателей нужно
Зависимость квадратичная и очень неприятная: чтобы уловить вдвое меньший эффект, нужно вчетверо больше людей. И всё упирается в вашу собственную открываемость — чем она ниже, тем больше выборка.
| Открываемость базы | Чтобы заметить прирост на четверть | Тестовая группа на 2 варианта |
|---|---|---|
| 25% | ~800 на вариант | ~1 600 |
| 20% | ~1 100 на вариант | ~2 200 |
| 10% | ~2 500 на вариант | ~5 000 |
| 5% | ~5 300 на вариант | ~10 700 |
| 3,5% | ~7 800 на вариант | ~15 500 |
Отсюда две вещи. Первая: универсальный совет «тестируйте на 1 000 подписчиков» бесполезен — на базе с открываемостью 25% этого хватит, на базе с 3,5% тест не покажет ничего, кроме шума. Вторая: если ваша открываемость низкая, честнее не тест на части базы, а тест на всей базе ради знания на будущее — победителю всё равно не осталось бы места.
Посчитать для своих цифр: калькулятор A/B-теста. Там же вторая вкладка — проверка уже проведённого теста, если он шёл в другом сервисе.
Сколько ждать
Открытия приходят неравномерно: примерно половина в первые часы, хвост тянется сутками. Ориентиры:
- 3–4 часа — минимум для активной базы, если тестируете тему;
- 24 часа — надёжнее, особенно если рассылка ушла вечером или в выходной;
- 1–3 суток — когда метрика клики, а не открытия;
- 3–7 суток — если считаете по заказам и выручке.
Слишком короткое окно систематически объявляет победителем письмо, которое просто быстрее открыли, — а не то, которое сработало лучше.
Осторожно с открытиями как метрикой
Apple Mail Privacy Protection и прокси почтовых служб подгружают трекинг-пиксель без участия человека. Часть «открытий» никто не читал, и доля этой части у разных вариантов одинакова только в среднем. Клики честнее — но их в разы меньше, и нужная выборка растёт соответственно. Разумный компромисс: тестируйте тему по открытиям, содержание — по кликам, и не сравнивайте между собой тесты разных лет: доля MPP со временем росла.
Чек-лист теста
Как это будет в MailerMail
раздел в разработке — на момент публикации функция ещё не доступна в кабинете
A/B-тесты кампаний спроектированы и стоят в плане разработки. Что в них закладывается:
- 2–4 варианта темы, содержания или имени отправителя; тест на части базы с автодосылкой победителя либо на всей базе ради знания;
- размер тестовой группы подбирается сам — по фактической открываемости именно вашей базы за прошлые рассылки, а не по общей рекомендации;
- предупреждение до запуска, если выборки не хватит: «при такой группе тест различит только прирост от 30% — всё, что меньше, неотличимо от случайности»;
- достоверность считается и объясняется словами: «победитель достоверен» / «похоже на победу, но данных мало — повторите» / «разницы не видно». Без этого A/B — генератор ложных выводов;
- победитель уходит остатку базы автоматически по окончании окна; досылка не открывшим строится по всем письмам теста сразу.
Арифметика, которая будет считать победителя в кабинете, уже работает — это она стоит за калькулятором. Хотите узнать о запуске — оставьте адрес.
Смежное: A/B-тест и Open Rate в глоссарии, чек-лист перед первой рассылкой, возможности кабинета рассылок.