A/B-тесты в Яндекс Директе: что и как тестировать
Большинство решений в рекламных кабинетах принимается на глаз. Менеджер поменял заголовок, через два дня посмотрел на CTR, увидел рост и решил, что новый вариант лучше. На самом деле он мог поймать случайное колебание, сезонный всплеск спроса или просто другой состав аудитории в эти конкретные дни. В B2B, где заявок мало, а цикл сделки длинный, такие ошибки стоят особенно дорого: вы масштабируете не то, что работает, а то, что показалось.
A/B-тест это способ проверить гипотезу честно, сравнивая два варианта в одинаковых условиях и оценивая, не случайна ли разница. В этой статье разберём, что реально стоит тестировать в Яндекс Директе, как организовать тест технически, как считать статистическую значимость на маленьких выборках и какие ошибки чаще всего приводят к ложным выводам. Все цифры в примерах условные, они нужны для иллюстрации логики, а не как нормативы.
Зачем вообще A/B-тестировать рекламу
Контекст это поток случайных событий. Один и тот же набор объявлений в понедельник и в четверг покажет разный CTR просто потому, что в выдачу попали разные люди в разном настроении и с разными запросами. Если вы сравниваете не два варианта между собой, а один вариант до изменения и после, вы фактически сравниваете разные периоды с разной погодой на рынке. Это не эксперимент, это гадание.
Корректный A/B-тест убирает влияние времени: оба варианта крутятся одновременно, на сопоставимой аудитории, и единственное системное отличие между ними это то, что вы тестируете. Тогда разницу в результатах можно отнести именно к вашей гипотезе, а не к внешним факторам. Цель не в том, чтобы найти красивую цифру, а в том, чтобы принимать решения, которые повторятся и в следующем месяце.
Что тестировать: от самого влиятельного к мелочам
Тестировать всё подряд бессмысленно. Начинайте с элементов, которые сильнее всего двигают экономику. Грубый приоритет такой.
Объявления: заголовки и тексты
Самый частый и самый быстрый тест. Заголовок первое, что видит человек, и небольшая смена формулировки иногда меняет CTR в полтора раза. Тестируйте разные углы: выгода против срочности, цена против экспертизы, вопрос против утверждения. Важно менять одну смысловую вещь за раз, иначе вы не поймёте, что именно сработало. О том, как формулировать сильные варианты, подробно написано в материале про продающие объявления в Яндекс Директе, а сам по себе CTR стоит разбирать отдельно, чтобы не путать кликабельность с качеством трафика.
Посадочные страницы
Объявление приводит клик, а деньги приносит лендинг. Часто гипотеза о росте конверсии лежит именно здесь: другой первый экран, другой оффер, форма из двух полей вместо пяти, квиз вместо классической формы. Тест посадочной обычно даёт больший прирост в заявках, чем перебор заголовков, потому что влияет на конверсию из клика в лид, а не только на трафик. Например, замена статичной страницы на квиз-лендинг для контекстной рекламы это полноценная A/B-гипотеза, которую легко проверить через сплит ссылок.
Аудитории, креативы и стратегии
В РСЯ есть смысл тестировать креативы (картинка и заголовок работают в связке), а также сегменты аудиторий. На уровне кампании можно сравнивать подходы к управлению ставками, но к этому стоит подходить осторожно: смена стратегии это не быстрый тест, обучению автостратегий нужно время и данные, и их сравнение это отдельный медленный тест.
Чего не стоит ждать от A/B-теста
Тест отвечает на вопрос «какой из двух вариантов лучше», но не строит стратегию за вас. Он не заменит нормальную семантику, проработку минус-слов и аналитику. Если фундамент кривой, вы будете аккуратно сравнивать два плохих варианта.
| Элемент | На что влияет | Скорость теста |
|---|---|---|
| Заголовок объявления | CTR, цена клика | Быстро |
| Текст и быстрые ссылки | CTR, качество клика | Быстро |
| Посадочная страница | Конверсия в заявку | Средне |
| Креатив в РСЯ | CTR, охват | Средне |
| Стратегия ставок | CPL, объём заявок | Медленно |
Главное правило: одна гипотеза за тест
A/B-тест проверяет одну переменную. Если вы одновременно поменяли заголовок, картинку и посадочную страницу, и результат вырос, вы не узнаете, что именно дало эффект, и не сможете повторить его в других кампаниях. Сформулируйте гипотезу так, чтобы её можно было опровергнуть: «заголовок с указанием цены даст более высокий CTR, чем заголовок с упором на экспертизу». Дальше тест либо подтверждает её, либо нет.
Менять несколько элементов сразу можно, но это уже не A/B, а сравнение двух концепций целиком. Такой подход уместен на старте, когда нужно быстро понять направление, но для тонкой настройки он не годится.
Как организовать тест технически
В Яндекс Директе нет единой кнопки «запустить A/B-тест», поэтому используют несколько подходов.
Эксперименты в Яндекс Аудиториях и Метрике. Это штатный инструмент: вы делите трафик на сегменты по принципу случайного распределения и привязываете их к разным кампаниям или вариантам страниц. Главный плюс в том, что один и тот же пользователь стабильно попадает в один сегмент, а деление честное.
Сплит на уровне объявлений в группе. Если в группе два объявления, система показывает их по очереди и со временем перераспределяет показы. Это удобно, но это не чистый A/B: алгоритм оптимизирует показы под более кликабельный вариант, поэтому выборки получаются неравными, а вывод смещённым в сторону CTR, а не конверсии в заявку.
Дублирование кампаний. Создаёте две одинаковые кампании, в каждой меняете один элемент, делите бюджет поровну. Способ грубый, на него влияют аукционные пересечения, но для крупных различий он работает.
Какой бы способ вы ни выбрали, обязательное условие это сквозной учёт результата. CTR виден в кабинете, но решение принимается по заявкам и их качеству, а это уже данные из Метрики и CRM. Без настроенной аналитики A/B-тест измеряет клики, а не деньги, и теряет смысл. Как связать рекламу с реальными продажами, разбирается в материале про оценку эффективности контекста по деньгам.
Сколько данных нужно и как считать значимость
Это место, где ломается большинство тестов в B2B. Заявок мало, и соблазн сделать вывод по трём лидам против одного огромный. Но разница между 3 и 1 на маленькой выборке это шум, а не сигнал.
Простая иллюстрация на условных числах. Вариант A: 1000 показов, конверсия в заявку 2,0 процента. Вариант B: 1000 показов, конверсия 2,4 процента. Кажется, что B лучше на 20 процентов. Но это 20 заявок против 24, и такая разница на тысяче наблюдений легко возникает случайно. Чтобы быть уверенным, что отличие не случайно, нужно либо больше данных, либо большая разница между вариантами.
Логика статистической значимости такая.
- Чем меньше выборка, тем большая разница нужна, чтобы ей можно было доверять.
- Чем больше разброс в данных, тем дольше копится надёжный результат.
- Уровень доверия обычно берут 95 процентов: это значит, что шанс принять случайность за результат не больше 5 процентов.
Считать руками необязательно. Есть бесплатные онлайн-калькуляторы A/B-значимости: вводите число показов и конверсий по каждому варианту и получаете, достоверна ли разница. Главное правило простое: не останавливайте тест в момент, когда увидели красивую цифру. Заранее решите, какой объём данных или какой срок вы набираете, и смотрите на итог только после этого. Подглядывание и досрочная остановка это главный способ обмануть самого себя.
Ориентир по длительности: тест должен покрыть хотя бы один полный недельный цикл, потому что поведение в будни и выходные в B2B сильно различается. Если заявок совсем мало, имеет смысл тестировать более верхние метрики (CTR, конверсию в клик по форме), а не финальные сделки, и подтверждать выводы накоплением данных за несколько недель.
Типичные ошибки, которые портят выводы
Слишком короткий тест. Остановили через два дня, потому что один вариант вырвался вперёд. На дистанции лидерство часто меняется.
Сравнение разных периодов. «Было» и «стало» это не A/B-тест. Между периодами меняется спрос, конкуренция и аукцион.
Несколько изменений сразу. Невозможно понять, что сработало, значит, невозможно повторить.
Оценка по кликам вместо заявок. Вариант с высоким CTR может приводить более дешёвый и менее целевой трафик. Если не довести измерение до заявки и сделки, можно оптимизировать рекламу в убыток. Эта и другие подобные ловушки описаны в подборке ошибок в контекстной рекламе, которые сжигают бюджет.
Неравные условия. Один вариант крутится в прайм-тайм, другой ночью. Деление должно быть случайным и одновременным.
Подглядывание и досрочная остановка. Если останавливать тест ровно тогда, когда цифра нравится, вы почти всегда найдёте «победителя», даже если разницы нет.
Что делать с результатом
Тест закончился, разница значима. Дальше внедряйте выигравший вариант как основной и сразу формулируйте следующую гипотезу. A/B-тестирование это не разовая акция, а постоянный процесс мелких улучшений: каждый подтверждённый шаг немного двигает экономику, и за квартал из таких шагов складывается заметный результат.
Если разница оказалась незначимой, это тоже полезный итог. Он говорит, что между вариантами нет различия, на которое стоит тратить внимание, и силы лучше направить на более крупную гипотезу, например на посадочную страницу или оффер, а не на цвет кнопки.
Частые вопросы
Можно ли проводить A/B-тесты при маленьком бюджете? Можно, но осторожно. На маленьком трафике надёжный результат по заявкам копится долго, поэтому тестируйте крупные различия (разные офферы, разные посадочные), а не мелкие нюансы, и опирайтесь на более частые метрики вроде CTR, подтверждая выводы за несколько недель.
Сколько времени должен идти тест? Минимум один полный недельный цикл, чтобы захватить и будни, и выходные. По объёму ориентируйтесь не на срок, а на достижение статистической значимости: пока разница не подтверждена, тест не закончен.
Чем A/B-тест отличается от сравнения «было и стало»? В A/B оба варианта работают одновременно на сопоставимой аудитории, поэтому внешние факторы влияют на них одинаково. Сравнение периодов смешивает ваш эффект с изменением спроса, сезона и конкуренции, и доверять ему нельзя.
Что лучше тестировать сначала: объявления или посадочную? Объявления тестируются быстрее и дешевле, но посадочная обычно сильнее влияет на конверсию в заявку. Если заявок мало, начните с крупной гипотезы по посадочной, если важна скорость, с заголовков.
Стоит ли тестировать автостратегии через A/B? Сравнивать стратегии можно, но это медленный тест: автостратегиям нужно время на обучение и достаточный объём конверсий. Не делайте выводов по первым дням, пока стратегия ещё учится.
Как понять, что разница не случайна? Используйте калькулятор статистической значимости: введите показы и конверсии по каждому варианту и проверьте уровень доверия. Стандарт 95 процентов. Если калькулятор показывает меньше, данных пока недостаточно.
Коротко: чеклист перед запуском теста
- Сформулирована одна проверяемая гипотеза, меняется одна переменная.
- Варианты крутятся одновременно на сопоставимой аудитории.
- Настроена сквозная аналитика: измеряются заявки и их качество, а не только клики.
- Заранее определён объём данных или срок, тест не останавливается досрочно.
- Покрыт хотя бы один полный недельный цикл.
- Результат проверен на статистическую значимость, а не на красоту цифры.
A/B-тесты превращают управление рекламой из набора догадок в управляемый процесс, где каждое решение опирается на данные. Но чтобы тесты давали отдачу, под ними должна быть выстроена аналитика и корректная настройка кампаний. Если хотите, чтобы реклама в Яндекс Директе работала на заявки и сделки, а не на клики, и проверялась системно, оставьте заявку в Lead The Way: поможем настроить аналитику, выстроить тесты и довести экономику до окупаемости.