A/B-тесты на сайте: что тестировать в первую очередь

В марте вы переписали заголовок на главной, и заявок стало на треть больше. В мае их снова мало, и никто в команде не может объяснить, что тогда сработало: новый текст, сезон или удачная неделя в рекламе. Правки по интуиции всегда дают такую картину. Сайт меняется каждый месяц, конверсия скачет, а понимания, что цепляет именно ваших клиентов, не прибавляется.

A/B тестирование сайта заменяет спор мнений экспериментом. Две случайные половины трафика видят разные версии страницы, и побеждает та, что приносит больше целевых заявок. Метод простой на словах и коварный на практике: легко поймать случайный шум вместо эффекта, остановить тест раньше срока или вырастить число заявок и просесть по их качеству, потому что форма стала слишком лёгкой для нецелевых посетителей.

В статье разберём, как провести A/B тест на сайте по шагам: гипотеза, размер выборки, длительность, оценка значимости простыми словами. Отдельно посмотрим на доступные в России инструменты, на B2B со скромным трафиком, где классические рецепты ломаются, и на то, как тесты уживаются с SEO.

Что даёт оптимизация сайта с помощью A/B тестов

Оптимизация сайта с помощью A/B тестов решает одну задачу: отделить изменения, которые двигают конверсию, от изменений, которые просто нравятся команде. Дизайнер уверен, что новый первый экран лучше. Руководитель видел похожий блок у конкурента. Маркетолог прочитал про «продающие» кнопки. Без эксперимента эти мнения равноценны, и побеждает самое громкое.

Механика теста: трафик случайно делится на группы, контрольная видит текущую версию страницы, тестовая видит изменённую, обе работают одновременно. Дальше сравнивается целевое действие: отправленная форма, звонок, заказ обратного звонка. Если разница между группами устойчива и её нельзя списать на случайность, гипотезу принимают и раскатывают победителя на весь трафик.

Слова «случайно» и «одновременно» здесь несущие. Сравнение «в марте сделали редизайн, в апреле выросла конверсия» ничего не доказывает: за месяц поменялись сезон, рекламные кампании, состав трафика и активность конкурентов. В A/B тесте обе версии живут в одних и тех же условиях, поэтому разница между ними объясняется именно изменением на странице.

У метода есть цена входа: трафик и конверсии. Условный ориентир: чтобы надёжно поймать рост конверсии с 3 до 4 процентов, каждой версии нужно порядка 5 тысяч посетителей, то есть около 10 тысяч на тест. Если на сайт приходит 300 человек в месяц и оставляют три заявки, сплит-тест растянется на годы. В такой ситуации сначала работают качественные методы и системная оптимизация конверсии: аудит юзабилити, интервью с клиентами, разбор записей сессий. Тесты подключаются позже, когда трафик подрос.

Как провести A/B тест на сайте: методика из шести шагов

Разберём, как организовать A/B тест на сайте так, чтобы его результату можно было верить. Схема одинаково работает для лендинга, страницы услуги и каталога, меняются только элементы и метрики.

Шаг 1. Найдите проблему и сформулируйте гипотезу

Тест начинается с данных о том, где сайт теряет людей. Посмотрите воронку в Яндекс Метрике: на какой странице обрывается путь к заявке, где доскроллы падают до нуля, какие поля формы бросают. Помогают тепловые карты и записи сессий в Вебвизоре: по ним видно, что посетители кликают по некликабельному блоку тарифов или не долистывают до кейсов.

Из наблюдения рождается гипотеза. Формула такая: «Если изменить X, метрика Y вырастет, потому что Z». Пример (условный): «Если в заголовке первого экрана указать нишу и результат, конверсия в заявку вырастет, потому что посетитель из рекламы за три секунды поймёт, что попал по адресу». Формулировка «давайте попробуем другой баннер» гипотезой считаться не может: из неё непонятно, чего ждём и почему.

Шаг 2. Выберите одну метрику успеха

До запуска зафиксируйте, по какому числу будете судить о победе. Для B2B-сайта здоровая метрика: целевые заявки, то есть отправленные формы от посетителей, которые проходят квалификацию. Клики по кнопке, доскроллы и время на странице годятся как вспомогательные сигналы. Решение по ним принимать нельзя: рост кликов без роста заявок означает, что вы сделали кнопку заметнее, и только.

Метрику успеха выбирают одну. Если версия B выиграла по заявкам и проиграла по глубине просмотра, побеждает версия B, потому что деньги приносят заявки.

Шаг 3. Рассчитайте размер выборки и длительность

Перед запуском прикиньте, сколько посетителей нужно каждой версии. Вводные три: текущая конверсия страницы, минимальный прирост, который вам интересен, и допустимый уровень ошибки. Считают это бесплатные калькуляторы размера выборки, их много в открытом доступе: вводите «конверсия 3%, хотим увидеть рост минимум на 20%», получаете число визитов на версию.

Закономерность стоит запомнить. Чем меньше исходная конверсия и чем меньше ожидаемый прирост, тем больше нужна выборка, причём зависимость резкая. Рост с 3 до 6 процентов виден на паре тысяч визитов, рост с 3 до 3,3 процента потребует десятков тысяч (числа условные, точный расчёт даёт калькулятор).

Длительность привязывайте к целым неделям. B2B-трафик живёт недельными циклами: в будни приходят люди с рабочих мест, в выходные поведение другое. Тест, запущенный во вторник и остановленный в пятницу, сравнивает несравнимое. Минимум одна-две полные недели, чаще две-четыре, пока не наберётся расчётная выборка.

Шаг 4. Настройте разделение трафика и замер

Посетители должны попадать в версии случайно, одновременно и «липко»: человек, увидевший версию B, при повторном визите видит её же. Иначе один и тот же посетитель насмотрится обеих версий, и чистота эксперимента пропадёт. Готовые инструменты (о них ниже) решают это сами через куки.

Замер настраивается до старта: цели на отправку каждой формы в Метрике, передача версии теста в CRM вместе с заявкой. Без второго пункта вы узнаете, какая версия собрала больше форм, и не узнаете, какая привела клиентов.

Шаг 5. Запустите и не вмешивайтесь

Самое трудное в тестировании: ничего не трогать. На третий день версия B опережает на 40 процентов, руки тянутся объявить победу. Через неделю разница тает до нуля. На малых числах колебания огромны, первые дни теста показывают шум. Дату проверки результата назначьте заранее и до неё в отчёты можно смотреть только на предмет технических поломок: работает ли форма в обеих версиях, не съехала ли вёрстка на мобильных.

Менять версии по ходу теста тоже нельзя. Поправили заголовок в версии B на второй неделе, значит, тест начался заново.

Шаг 6. Оцените значимость и примите решение

Когда выборка набрана, сравните конверсии и проверьте статистическую значимость (следующий раздел). Дальше три исхода. Версия B выиграла значимо: раскатываете её на весь трафик и фиксируете знание в базе гипотез. Разница незначима: оставляете исходную версию, гипотеза не подтвердилась, это тоже результат. Версия B значимо проиграла: поздравьте себя, тест только что спас вам конверсию, которую убила бы правка «по интуиции».

Крупные победы полезно перепроверять. Если тест показал рост на 50 процентов, а гипотеза была скромной, повторите эксперимент: иногда «победа» оказывается стечением обстоятельств одной конкретной пары недель.

Статистическая значимость простыми словами

Представьте, что вы подбросили монету десять раз и получили семь орлов. Монета кривая? Вряд ли, семь из десяти легко выпадают и у честной монеты. А вот 700 орлов из 1000 бросков уже повод для подозрений. Статистическая значимость отвечает ровно на этот вопрос: могла ли наблюдаемая разница между версиями возникнуть случайно, без всякого эффекта от вашей правки.

В отчётах инструментов это выглядит как «достоверность 95%» или «p-value 0,05». Читается так: если бы версии на самом деле работали одинаково, такая разница в конверсиях выпадала бы случайно примерно в одном тесте из двадцати. Порог 95% принят как разумный компромисс для маркетинга. Хотите меньше риска, поднимайте до 99% и готовьтесь собирать выборку заметно дольше.

Важная оговорка: значимость не измеряет размер выгоды. Разница «3,00% против 3,05%» на миллионной выборке будет статистически значимой и бесполезной для бизнеса. Поэтому до теста вы и фиксируете минимальный интересный прирост: эффект мельче этого порога не окупит даже времени на эксперимент.

И вторая оговорка, про подглядывание. Если проверять значимость каждый день и останавливать тест в момент, когда она «случилась», доля ложных побед вырастает в разы. Инструменты вроде Varioqub считают достоверность за вас, но дисциплина «решение только по итогам заранее заданного срока» остаётся на вашей стороне.

Что тестировать в B2B при малом трафике

Типичный B2B-сайт собирает от одной до десяти тысяч визитов в месяц и десятки заявок. Выборка на тонкие эффекты не набирается физически. Отсюда главное правило: при малом трафике тестируют крупные изменения с большим ожидаемым эффектом. Смена оттенка кнопки может дать плюс 2 процента к конверсии, и вы это никогда не докажете. Новый оффер на первом экране может дать плюс 40 процентов, и это уже ловится на вашей выборке.

Приоритет удобно раскладывать по двум осям: сколько посетителей видит элемент и насколько он влияет на решение оставить заявку.

Приоритет гипотез для B2B-сайта с малым трафиком (условная оценка)
Элемент Кто видит Влияние на заявку Очередь
Оффер и заголовок первого экрана Все посетители Высокое Первая
Форма заявки: число полей, шаги Дошедшие до формы Высокое Первая
Текст призыва к действию Все посетители Среднее Вторая
Кейсы, отзывы, логотипы клиентов Долиставшие до блока Среднее Вторая
Цвет кнопок, иконки, мелкий дизайн Все посетители Низкое Последняя

Первый экран. Здесь посетитель за секунды решает, остаться или закрыть вкладку. Тестируйте смысл: оффер через процесс («настраиваем Яндекс Директ») против оффера через результат («приводим целевые заявки для производителей оборудования»), общие слова против конкретики с цифрами и сроками. Такие сравнения двигают конверсию на десятки процентов, что и нужно при скромной выборке.

Форма заявки. Последний барьер перед конверсией. Рабочие гипотезы: сократить поля до имени и телефона, разбить длинную форму на два шага, заменить открытый вопрос выпадающим списком, показать форму сразу вместо формы по клику. Есть обратная сторона: лёгкая форма пропускает больше нецелевых обращений, поэтому победителя оценивайте по заявкам, дошедшим до квалификации. Приёмы для этого блока мы разобрали в статье про форму заявки на сайте.

Призыв к действию и доверие. «Оставить заявку» против «Получить расчёт стоимости» против «Обсудить задачу». Для блоков доверия проверяйте расположение и формат: кейсы с цифрами ближе к первому экрану, видеоотзыв против текстового. Вторая очередь, но в B2B именно эти блоки снимают возражения перед дорогой сделкой.

Косметику оставьте на времена большого трафика. Контраст кнопки проверяется взглядом на макет, для этого эксперимент не нужен.

Если даже крупные гипотезы не набирают выборку, есть обходные пути. Тестируйте шаблонные элементы сразу на всех страницах сайта: единая форма или общий блок CTA соберёт трафик быстрее, чем одна страница. Снизьте порог достоверности с 95 до 90 процентов, осознанно приняв больший риск ошибки. Часть гипотез проверяйте вообще без сплита: пять интервью с клиентами покажут провалы оффера быстрее, чем месяц эксперимента.

Инструменты A/B тестирования, доступные в России

Google Optimize, который годами был стандартом бесплатных тестов, закрыт с осени 2023 года. В рунете основной связкой стала Яндекс Метрика плюс Varioqub.

Varioqub это сервис A/B-экспериментов Яндекса, интегрированный с Метрикой и Директом. Он умеет делить трафик, подменять элементы страницы через визуальный редактор без программиста, держать «липкость» версий и считать достоверность результата. Для типовых задач (заголовки, тексты, кнопки, скрытие блоков) его хватает, тариф бесплатный. Из ограничений: сложные изменения вёрстки всё равно потребуют кода, а подмена происходит скриптом в браузере, поэтому следите, чтобы страница не «мигала» исходной версией перед показом варианта.

Яндекс Метрика в связке отвечает за замер: цели на формы и звонки, сегменты по версиям эксперимента, воронки. Если цели ещё не настроены или настроены криво, начните с этого, без корректного замера любой тест бесполезен.

Свой сплит на сервере или в конструкторе. Часть конструкторов сайтов (например, Tilda на платных тарифах) поддерживает A/B тесты страниц из коробки. Для сайтов на своём коде сплит пишется руками: случайное распределение по куке, две версии шаблона, передача версии в аналитику и CRM. Дороже в настройке, зато без мигания и с полным контролем.

Эксперименты в Директе. Гипотезы про объявления, креативы и стратегии тестируются на стороне рекламной системы, там своя механика и свои метрики. Этому мы посвятили отдельный разбор про A/B-тесты в Яндекс Директе. Практично разделять: страницы тестируем на сайте, трафик в рекламном кабинете, и никогда одновременно на одной связке, иначе эффекты перемешаются.

Улучшение конверсии сайта через A/B тесты: считаем в заявках и сделках

Улучшение конверсии сайта через A/B тесты легко превратить в самообман, если оптимизировать промежуточные цифры. Условный пример: версия B с упрощённой формой и обещанием «бесплатного аудита» собрала 60 заявок против 40 у версии A. Победа? Отдел продаж квалифицировал из них 12, а из сорока заявок версии A целевыми оказались 18. Версия A принесла больше денег при худшей конверсии в форму.

Поэтому зрелая схема замера трёхуровневая. Первый уровень: конверсия в заявку, её считает Метрика. Второй: доля целевых заявок, её видно в CRM после квалификации. Третий: сделки и выручка по каждой версии. Для второго и третьего уровня версия эксперимента должна доезжать до CRM вместе с заявкой, это делается скрытым полем формы или меткой. Связку «версия страницы, заявка, статус, сделка» строит сквозная аналитика, и для сайтов с тестами она обязательна, без неё вы видите только верх воронки.

Длинный цикл сделки вносит поправку: B2B-сделка закрывается месяцами, ждать её в рамках теста нереально. Компромисс такой: решение принимайте по целевым заявкам (квалификация занимает дни), а через квартал возвращайтесь к данным и проверяйте, довёл ли победитель сделки. Расхождения между «больше целевых заявок» и «больше сделок» встречаются редко, но проверка дешёвая, а урок ценный.

A/B тестирование и его влияние на SEO

Владельцев сайтов с поисковым трафиком часто останавливает страх: увидит ли поисковик две версии страницы и не примет ли это за манипуляцию. Практика A/B тестирования и SEO мирно сосуществуют, если соблюдать несколько правил, которые сами поисковики и описали.

Первое: никакого клоакинга. Роботу нельзя показывать специальную версию, отличную от того, что видят люди. Инструменты вроде Varioqub подменяют контент честно, скриптом в браузере, робот попадает в те же группы эксперимента, что и посетители, это нормально.

Второе: если варианты живут на разных URL, на тестовой странице ставится rel=canonical на основную. Так поисковик понимает, что вторая страница временный вариант, и не плодит дубли в индексе.

Третье: редиректы в тестах только временные, 302. Постоянный 301 сигнализирует поисковику, что старый адрес умер, и передаёт ему вес нового, чего в эксперименте вы не хотите.

Четвёртое: тест конечен. Эксперимент, который «висит» полгода, поисковик вправе трактовать как попытку показывать разным пользователям разное на постоянной основе. Завершили тест, раскатали победителя на 100 процентов трафика, убрали скрипт подмены.

Есть и обратное направление: оптимизация SEO с помощью A/B тестирования. Классический сплит в поисковой выдаче невозможен, вы не управляете тем, какую версию сниппета покажет Яндекс. Работают квазиэксперименты: меняете title и description на одной группе однотипных страниц, вторую группу оставляете как контроль, через три-четыре недели сравниваете CTR и переходы в Вебмастере. Метод грубее честного A/B (группы страниц никогда не идентичны), но направление эффекта он показывает. Косвенная связь тоже есть: версия страницы, которая лучше удерживает посетителей и собирает больше конверсий, улучшает поведенческие сигналы, а их поисковики учитывают.

Типичные ошибки A/B тестирования

  • Тест без гипотезы. «Попробуем другой первый экран» не объясняет, чего ждём и почему. Без формулы «меняем X, ждём рост Y, потому что Z» результат нечему подтверждать.
  • Ранняя остановка. Победителя объявляют на третий день по красивой промежуточной цифре. Лекарство: срок и выборка фиксируются до запуска.
  • Несколько переменных сразу. Поменяли заголовок, форму и цены, конверсия выросла, вклад каждого изменения неизвестен. Исключение: осознанный тест двух целостных концепций страницы.
  • Оптимизация микроцелей. Клики по кнопке выросли, заявки нет. Решение принимается по заявкам и их качеству.
  • Игнор сегментов. Версия B выигрывает на десктопе и проваливается на мобильных, в среднем «ничья». Смотрите разбивку по устройствам и источникам, но помните: чем мельче сегмент, тем меньше в нём данных и тем шумнее вывод.
  • Тест на грязном трафике. Если на страницу льётся нецелевой трафик из рекламы, вы измеряете качество источника вместо качества страницы. Сначала чистка кампаний, потом тесты.
  • Мигание версий. Скрипт подмены срабатывает с задержкой, посетитель видит исходник, потом вариант. Это искажает результат и раздражает людей. Проверяйте скорость до запуска.

Частые вопросы

Как организовать A/B тест на сайте, если трафика мало? Тестируйте крупные изменения с ожидаемым эффектом от 20-30 процентов: оффер, концепцию первого экрана, форму целиком. Запускайте эксперимент на шаблонных элементах сразу всех страниц, чтобы быстрее набрать выборку. Порог достоверности можно осознанно снизить до 90 процентов. А часть гипотез дешевле проверить интервью с клиентами и записями сессий, без сплита.

Сколько времени должен идти A/B тест? Целое число недель, минимум одну-две, и до набора рассчитанной заранее выборки. На типичном B2B-сайте это две-четыре недели. Если выборка не набирается за пару месяцев, честный вывод такой: трафика для этого теста недостаточно, гипотезу нужно укрупнить или проверить другим методом.

Чем AB тестирование лендинга отличается от теста многостраничного сайта? Механика та же, проще логистика. На лендинге весь трафик сосредоточен на одной странице, выборка набирается быстрее, а изменение видят все посетители. На многостраничном сайте тестируют либо конкретную страницу (и ждут дольше), либо сквозные элементы: шапку, форму, блок CTA на всех страницах сразу.

Влияет ли A/B тестирование на SEO и позиции сайта? При корректной настройке риска нет: пользователи и роботы видят одинаковые версии, варианты на отдельных URL закрыты через rel=canonical, редиректы временные (302), тест ограничен по сроку. Затяжные эксперименты на месяцы и подмена контента только для робота уже опасны.

Какие инструменты для аб тестирования сайта работают в России? Основная бесплатная связка: Яндекс Метрика для целей и замера плюс Varioqub для деления трафика, визуального редактора вариантов и оценки достоверности. Часть конструкторов (Tilda и другие) умеет тесты из коробки. Для сайтов на своём коде сплит реализуют на сервере. Google Optimize закрыт, рассчитывать на него больше нельзя.

Можно ли тестировать несколько элементов одновременно? Несколько правок внутри одной концепции допустимы, тогда вы тестируете концепцию целиком против старой страницы. Вклад каждого элемента по отдельности при этом останется неизвестным. Мультивариантные тесты, где комбинации элементов сравниваются между собой, требуют трафика на порядок больше и в B2B почти никогда не окупаются.

Заключение

A/B тестирование превращает работу над сайтом из череды вкусовых правок в накопление проверенных знаний о ваших клиентах. Дисциплина решает больше, чем инструменты: внятная гипотеза, одна метрика успеха, рассчитанная выборка, целые недели без вмешательства и оценка победителя по целевым заявкам и сделкам.

Чеклист перед запуском теста:

  • Гипотеза записана в формате «меняем X, ждём рост Y, потому что Z».
  • Выбран элемент с большим охватом и влиянием на заявку, при малом трафике изменение крупное.
  • Метрика успеха одна: целевые заявки, версия эксперимента передаётся в CRM.
  • Размер выборки рассчитан калькулятором, срок кратен неделе, минимум две.
  • Трафик делится случайно, версии работают одновременно, посетитель закреплён за своей версией.
  • Промежуточные цифры не влияют на решение, дата подведения итогов назначена заранее.
  • Для страниц с поисковым трафиком: без клоакинга, canonical на основной URL, редиректы 302.

Если хотите выстроить тестирование как систему, связать его со сквозной аналитикой и принимать решения по сделкам, команда Lead The Way поможет: от настройки Метрики и Varioqub до базы гипотез и регулярных экспериментов. Расскажите о своей задаче, и мы предложим, с каких тестов начать именно на вашем сайте.