A/B-тесты рассылок: как получить результат, которому можно верить

Сплит-тест — единственный способ узнать, что работает на вашей базе, а не на чьей-то чужой. И самый простой способ обмануть себя, если считать победителем того, у кого процент выше.

Как устроен тест

Базу делят случайно на группы, каждой отправляют свой вариант письма, ждут заданное время и сравнивают. Дальше — либо тест шёл на всей базе, и вы просто узнали что-то на будущее, либо тестовой группой была её часть, и победивший вариант автоматически уходит остальным.

Классическая пропорция: 20–30% базы уходит в тест, остальные получают победителя. Но эти проценты — не правило, а следствие арифметики: сколько нужно людей, чтобы разница вообще стала различима. Ниже как раз об этом.

Что тестировать

ЭлементНа что влияетЗамечание
Тема письмаоткрытияСамый частый и самый быстрый тест. Длина, вопрос против утверждения, цифра в теме, эмодзи.
ПрехедероткрытияРаботает в паре с темой: в списке писем их читают вместе.
Имя отправителяоткрытия, жалобы«Компания» против «Имя из компании». Влияет и на узнаваемость — менять часто нельзя.
Содержание, кнопка, офферкликиТребует заметно большей выборки, чем тест темы: кликов всегда в разы меньше открытий.
Время отправкиоткрытияОсобый случай: результат — рекомендация на будущее, а не выбор письма для остатка базы. Требует повторов, чтобы отделить день недели от часа.

Меняйте одно за раз. Если у варианта B другая тема и другая картинка, победа B не скажет, что именно сработало, — и перенести вывод на следующие рассылки будет некуда.

Главная ошибка: сравнивать проценты

Открытия и клики — случайные события. Возьмите два полностью одинаковых письма, разошлите их двум случайным половинам базы — доли почти никогда не совпадут. У одной будет 3,4%, у другой 3,8%. Разница есть, победителя нет.

Поэтому вопрос не «у кого процент выше», а «переживёт ли это расхождение повтор». Ответ на него даёт статистическая проверка: она считает, насколько вероятно увидеть такую разницу, если письма на самом деле одинаковы. Если вероятность мала — разница настоящая.

Практическое следствие важнее формулы: маленькая выборка не «менее точна» — она вводит в заблуждение. Она регулярно выдаёт красивых победителей, которых нет, и вы переносите выдуманное правило на все следующие рассылки.

Сколько получателей нужно

Зависимость квадратичная и очень неприятная: чтобы уловить вдвое меньший эффект, нужно вчетверо больше людей. И всё упирается в вашу собственную открываемость — чем она ниже, тем больше выборка.

Открываемость базыЧтобы заметить прирост на четвертьТестовая группа на 2 варианта
25%~800 на вариант~1 600
20%~1 100 на вариант~2 200
10%~2 500 на вариант~5 000
5%~5 300 на вариант~10 700
3,5%~7 800 на вариант~15 500

Отсюда две вещи. Первая: универсальный совет «тестируйте на 1 000 подписчиков» бесполезен — на базе с открываемостью 25% этого хватит, на базе с 3,5% тест не покажет ничего, кроме шума. Вторая: если ваша открываемость низкая, честнее не тест на части базы, а тест на всей базе ради знания на будущее — победителю всё равно не осталось бы места.

Посчитать для своих цифр: калькулятор A/B-теста. Там же вторая вкладка — проверка уже проведённого теста, если он шёл в другом сервисе.

Сколько ждать

Открытия приходят неравномерно: примерно половина в первые часы, хвост тянется сутками. Ориентиры:

  • 3–4 часа — минимум для активной базы, если тестируете тему;
  • 24 часа — надёжнее, особенно если рассылка ушла вечером или в выходной;
  • 1–3 суток — когда метрика клики, а не открытия;
  • 3–7 суток — если считаете по заказам и выручке.

Слишком короткое окно систематически объявляет победителем письмо, которое просто быстрее открыли, — а не то, которое сработало лучше.

Осторожно с открытиями как метрикой

Apple Mail Privacy Protection и прокси почтовых служб подгружают трекинг-пиксель без участия человека. Часть «открытий» никто не читал, и доля этой части у разных вариантов одинакова только в среднем. Клики честнее — но их в разы меньше, и нужная выборка растёт соответственно. Разумный компромисс: тестируйте тему по открытиям, содержание — по кликам, и не сравнивайте между собой тесты разных лет: доля MPP со временем росла.

Чек-лист теста

1. ГипотезаОдно изменение и ожидаемый эффект: «вопрос в теме поднимет открытия» — а не «попробуем что-нибудь».
2. ВыборкаПосчитана заранее по вашей открываемости, а не взята как «20%, все так делают».
3. Случайное делениеГруппы формируются случайно, а не «первая тысяча — сюда»: иначе сравните старых подписчиков с новыми.
4. ОкноЗадано до старта. Подглядывать и останавливать тест, когда «уже видно победителя», нельзя — так победитель находится всегда.
5. ПроверкаРазница проверена статистически. Недостоверный результат — это тоже результат: значит, элемент не влияет.
6. ЗаписьЧто тестировали, что вышло, какая была выборка. Через полгода это ваша собственная база знаний, а не общие советы из интернета.

Как это будет в MailerMail

раздел в разработке — на момент публикации функция ещё не доступна в кабинете

A/B-тесты кампаний спроектированы и стоят в плане разработки. Что в них закладывается:

  • 2–4 варианта темы, содержания или имени отправителя; тест на части базы с автодосылкой победителя либо на всей базе ради знания;
  • размер тестовой группы подбирается сам — по фактической открываемости именно вашей базы за прошлые рассылки, а не по общей рекомендации;
  • предупреждение до запуска, если выборки не хватит: «при такой группе тест различит только прирост от 30% — всё, что меньше, неотличимо от случайности»;
  • достоверность считается и объясняется словами: «победитель достоверен» / «похоже на победу, но данных мало — повторите» / «разницы не видно». Без этого A/B — генератор ложных выводов;
  • победитель уходит остатку базы автоматически по окончании окна; досылка не открывшим строится по всем письмам теста сразу.

Арифметика, которая будет считать победителя в кабинете, уже работает — это она стоит за калькулятором. Хотите узнать о запуске — оставьте адрес.

Смежное: A/B-тест и Open Rate в глоссарии, чек-лист перед первой рассылкой, возможности кабинета рассылок.