Вывод из теста появляется тогда, когда до запуска записаны 3 вещи: проверяемая гипотеза, метрика сравнения и решение, которое примем при каждом исходе. Без этих записей запуск нескольких вариантов даёт таблицу с цифрами, а не ответ: варианты отличаются всем сразу, метрику выбирают задним числом, а разницу объясняет случайность.
Вторая половина дела — арифметика. У каждого варианта должно накопиться достаточно целевых действий, иначе отрыв в 20 % ничего не доказывает. Дальше — порядок подготовки теста, способ прикинуть нужный бюджет, правила выбора метрики и признаки того, что результат читать нельзя.
Что записать до запуска: гипотеза и решение#
Гипотеза — это утверждение, которое может оказаться неверным. «Попробуем новые баннеры» гипотезой не будет. «Объявление с указанием срока изготовления соберёт заявки дешевле, чем объявление со скидкой» — будет: формулировка сразу задаёт, что меняем и что сравниваем, и не даёт после запуска подогнать трактовку под полученный результат.
В одном круге меняют одну вещь. Варианты, которые отличаются картинкой, заголовком и кнопкой сразу, сравнивать можно, но выводом это не станет: победа варианта Б не покажет, какой из трёх элементов её принёс, и перенести находку в следующие кампании не получится. Исключение — сравнение двух принципиально разных подходов, когда проверяют направление, а не деталь.
Третья запись — правило решения. До запуска фиксируют: при каком отрыве вариант признаём победителем, что делаем при равенстве, в какой момент останавливаем тест. Заодно полезно отсечь мелочи: оттенок кнопки или шрифт на скромном бюджете не проверить. Тестируют то, что меняет смысл сообщения, — оффер, боль клиента, формат подачи, тип героя на фотографии.
Сколько бюджета и времени нужно одному варианту#
Объём теста считают не в днях, а в целевых действиях. Возьмите текущую цену действия — клика, если сравниваете внимание, или заявки, если сравниваете деньги, — и умножьте на количество действий, которое хотите набрать на один вариант. Полученная сумма и есть бюджет варианта, дальше её умножают на число вариантов в круге.
Сколько действий достаточно, зависит от ожидаемой разницы. Отрыв в разы заметен уже на десятках событий, отрыв в 10–15 % на таком объёме неотличим от случайности. Отсюда практическое следствие: на небольшом бюджете проверяют крупные различия, а тонкие настройки оставляют кампаниям с большим потоком. Если денег хватает лишь на десяток заявок на вариант, сравнение ведут по кликам, а заявки читают как подсказку.
Срок выбирают кратно неделе: спрос по дням недели неровный, и тест с четверга по воскресенье сравнивает не креативы, а дни. Вариантов на старте берут 3–4, не больше: каждый лишний делит бюджет и отодвигает момент, когда цифрам можно верить. Заведомо слабые отключают по ходу, оставшиеся дорабатывают в следующем круге.
По какой метрике сравнивать варианты между собой#
CTR измеряет внимание, а не спрос. Креатив с провокацией, крупной цифрой или лицом почти всегда обгоняет спокойный по кликам и нередко проигрывает ему по заявкам: он приводит любопытных. Поэтому CTR годится для быстрого отсева очевидно слабых вариантов, а решение о победителе принимают на метрике, которая ближе к деньгам.
Рабочая цепочка выглядит так: показы, клики, заявки, продажи. Сравнивать нужно на самом глубоком уровне, где набралось достаточно событий, — обычно это стоимость заявки. Как считать её без искажений, разобрано в материале про стоимость лида. Глубже, на уровне сделок, данных за срок теста почти никогда не хватает.
Отдельно проверяют качество. Креатив меняет не только количество обращений, но и состав людей: обещание бесплатного расчёта собирает тех, кто коллекционирует расчёты. Поэтому рядом с основной метрикой держат 1–2 контрольные: долю целевых заявок по оценке менеджера и долю дошедших до разговора. Вариант с дешёвыми, но пустыми заявками победителем не считают.
Признаки того, что результат читать нельзя#
Первая причина — мало событий. Разница между 12 и 15 заявками выглядит как заметное преимущество и рассыпается на следующей неделе. Быстрая проверка: мысленно перенесите 2–3 заявки из одного варианта в другой. Если вывод меняется на противоположный, читать нечего, тест нужно продлевать или укрупнять различия между вариантами.
Вторая — неравные условия. Автоматика площадки быстро отдаёт показы тому варианту, который понравился ей по ранним сигналам, и остальные получают другой объём и другую аудиторию. Признак: расход по вариантам разошёлся в разы к концу первого дня. Лечится разнесением вариантов по отдельным группам с собственными бюджетами либо сравнением последовательных периодов равной длины.
Третья — выгорание и посторонний фон. Креатив, который аудитория видела месяц, проиграет свежему почти наверняка, и это говорит о частоте показов, а не о качестве идеи. Так же искажают картину акция, сезон и правки на сайте посреди теста. Отдельный случай — все варианты дали одинаково плохой результат: тогда перебирать картинки бессмысленно, проверять нужно предложение, и начинают с УТП.
Вывод: тест как процедура, а не разовая затея#
Один тест сам по себе даёт мало: он отвечает на один вопрос и часто отрицательно. Ценность появляется на дистанции, когда круги идут друг за другом и каждый следующий опирается на предыдущий. Рабочий ритм для малого бизнеса — новый круг раз в 2–4 недели, по одной гипотезе за круг, с одинаковым порядком подготовки.
Порядок такой: сформулировать гипотезу утверждением, оставить одну переменную, назвать метрику и правило решения, посчитать бюджет от цены целевого действия, запустить кратно неделе и не трогать настройки до конца срока. Итог записать в общий журнал: что проверяли, что победило, на каком объёме данных, какое решение приняли.
Журнал важнее отдельного победителя. Через несколько кругов из него видно, какие смыслы работают на этой аудитории, а какие не заходят никогда, и новые креативы начинают собираться из проверенных элементов, а не из идей на совещании. Начать стоит с правила решения: строчка «победителем считаем вариант с заявками дешевле на четверть при равном качестве» превращает спор о вкусах в проверку одного числа.