Перейти к содержимому

Как проводить аб тест в вконтакте

  • автор:

A/B-тестирование (и не только) в социальных сетях: условия, способы, креативы

Социальные сети — мощный маркетинговый инструмент, который, позволяет создавать уникальную рекламу для взаимодействия с аудиторией. Для того чтобы определить самые эффективные объявления, вам не обойтись без А/В-тестирования (или других видов). В этой статье мы разберемся, как тестировать креативы, на что обращать внимание и как оценивать результат.

Универсальных рекомендаций и идей для создания идеальных креативов, к сожалению, не существует. Тренды стремительно сменяют друг друга, у пользователей появляются новые потребности, вкусы и привычки, аудитории постепенно выгорают. Разумеется, в такой гонке сложно поддерживать эффективность рекламы, контролировать конверсии и подогревать интерес пользователей, ориентируясь исключительно на интуицию. Надо выяснить, какие креативы сработали и понравились аудитории.

И тут к вам на выручку приходит А/В-тестирование — один из самых важных этапов запуска любой рекламной кампании. С его помощью вы определите, какие комбинации креативов/таргетингов “выстреливают”, и на основании этой информации внесете изменения в свои объявления, а за одно пощадите бюджет.

А/В-тестирование — способ получения статистической информации, на основании которой вы сможете скорректировать дальнейшую стратегию.

С главным разобрались, теперь можно переходить к переменным, которые следует проверить.

При выборе того или иного метода тестирования необходимо учитывать несколько важных факторов: стратегию, бюджет, особенности продукта и ниши, а также площадку, на которой вы хотите запустить рекламу.

Многие специалисты рекомендуют выделять на тестирование 25-30% бюджетных средств, и мы также придерживаемся этого мнения.

Если в сплит-тестирование заложить слишком маленький бюджет, вы не получите объективных статистических данных, соответственно, мероприятие не сможет выполнить свою основную задачу. Если же вы потратите слишком много средств на этапе тестирования, то рискуете перестараться — для достаточного количества показов наиболее эффективного объявления оставшегося бюджета может не хватить.

Существует три варианта тестирования креативов:

Одновременное

Создайте несколько объявлений и подберите для них одинаковую аудиторию. В настройках задайте равный временной промежуток и показы для всех креативов. По итогам тестирования сравните, на какой вариант лучше отреагировали пользователи (при этом ориентируйтесь на значение CTR).

Последовательное Если вы хотите воспользоваться этим методом, создайте разные варианты объявлений, которые собираетесь протестировать, и запустите их подряд, например, со временным промежутком в несколько часов.

Сплит-тестирование

Стандартное А/В-тестирование предполагает, что во время эксперимента аудитории разбиваются на две части и не пересекаются. Не обязательно ограничиваться двумя креативами, их может быть намного больше (соответственно разбиваются и аудитории). Главное преимущество такой методики — более объективная выборка юзеров. Для сплит-тестирования понадобится больше времени и средств, чем в описанных выше способах, но оно поможет получить точную статистику.

Тестирование объявлений в ВКонтакте

Т.е. при тестировании в каждом объявлении должно меняться только что-то одно — либо картинка, либо текст, либо сегмент аудитории. Иначе вы не поймете, от чего изменилась эффективность.

  • Делим всю базу на 10-20 сегментов
  • На 1-2 сегмента, которые по ожиданиям должны быть наиболее теплыми (т.е. готовыми к покупкам наших товаров и услуг), даем 10-20 объявлений с разными картинками и одинаковыми текстами.
  • Обычно успешные или неуспешные объявления видны уже после первых 20-30 р. открутки. По остальным даем докрутиться до 100-200 р. на объявление, затем выбираем лучшее.
  • По результатам открутки выбираем 1-2 лучшие картинки, делаем с ними 10-20 объявлений с разными текстами.
  • По результатам открутки мы получаем 2-3 наиболее эффективных картинки и 2-3 лучших текста. Вот их мы и ставим на все сегменты, в которых ТА ЖЕ ЦА.

Если же у нас аудитория сегментируется еще и по соц.-дем. и прочим характеристикам (например, те, кому нужны часы, и те, кому нужны мультиварки), то на этих сегментах, соответственно, точно так же проводим тестирование объявлений. И эти сегменты тоже желательно дробить по уровню подогретости аудитории — тогда вы сможете на самую горячую аудиторию поднимать цены дольше и выше, т.к. цена покупки с нее будет дешевле. А на более холодной аудитории оставлять цены ниже, т.к. созревание до покупки там будет дольше.

ВАЖНО: при тестировании учитывайте не только CTR, но и конверсию, и цену целевого действия. Иногда (и чаще всего) у лучшего по CTR объявления может быть худшая конверсия, и наборот.

Что такое A/B-тестирование и как провести его правильно | Урок 1/15

Olga Zholudova

А/В тестирование — это метод сравнения двух версий страницы или приложения, чтобы понять, какая из них работает лучше в контексте какой-то конкретной задачи. Это один из самых популярных методов повышения производительности (performance)цифровых объектов: сайтов, мобильных приложений, SaaS-продуктов, рассылок и т.п.

Вы читаете перевод руководства по A/B тестированию от компании Dynamic Yield. Над переводом работали Оля Жолудова и Ринат Шайхутдинов. При поддержке koptelnya.ru.

Коптельня — команда по быстрой разработке веб-приложений и сайтов.

Автор этого урока: Янив Навот, CMO, Dynamic Yield

Содержание:

При помощи контролируемых экспериментов маркетологи, продакт-менеджеры и разработчики могут быстро проверять свои творческие идеи на жизнеспособность и, отталкиваясь от объективных данных, быстро и гибко внедрять самые удачные из них в продукт. Короче говоря, вам больше не надо рассуждать, почему тот или иной вариант страницы более удачный: эксперимент все скажет сам за себя. Этот метод идеально подходит, когда нужно поднять конверсию, увеличить выручку, нарастить базу подписчиков или привлечь побольше клиентов и лидов.

Глобальные компании, такие как Google, Amazon, Netflix и Facebook, таким образом выстроили процессы в бизнесе, чтобы проводить тысячи экспериментов в год и оперативно внедрять их результаты в работу.

Джефф Безос однажды сказал: “Успех Amazon зависит от того, сколько экспериментов мы сможем провести в год, в месяц, в неделю, в день”.

В технологическом блоге Netflix в апреле 2016 года прозвучала такая фраза: “Благодаря эмпирическому подходу к работе, мы можем быть уверены, что изменения в продукте продиктованы не вкусами и мнениями самых авторитетных сотрудников компании, а объективными данными. То есть наши зрители сами подсказывают нам, что им нравится”.

И Марк Цукерберг в одном из интервью признался, что успех Facebook кроется в их уникальной системе тестирования, чем предприниматель очень гордится: “В любую секунду в мире работает не одна версия Facebook, а порядка 10,000”.

Что такое A/B тест?

В классическом A/B тесте, мы первым делом определяем, что будем тестировать и какова наша задача. Далее мы создаем одну или несколько вариаций исходного (контрольного) веб-элемента. Далее, мы делим трафик пополам в случайном порядке (то есть распределяем пользователей согласно некой вероятности), и, наконец, собираем данные (метрики) о том, как работает каждая версия страницы. Спустя какое-то время, мы анализируем данные и оставляем ту версию, которая отработала лучше, а менее удачную — выключаем.

Очень важно проводить тесты грамотно: иначе вы не только не получите осмысленные и полезные результаты, но и вообще можете пойти по ошибочному пути. В целом, контролируемые эксперименты могут помочь в решении следующих задач:

  1. Разобраться с недочетами UX и популярными барьерами для клиентов (pain points)
  2. Повысить эффективность существующего трафика (поднять конверсию (conversions)и выручку (revenue), оптимизировать затраты на привлечение клиентов (customer acquisition costs))
  3. Поднять вовлеченность (снизить показатель отказов (bounce rate), повысить показатель кликабельности (click-through rate) и т.д.)

Нужно помнить, что когда мы отдаем предпочтение тому или иному варианту, мы по сути масштабируем (раскатываем) результаты, полученные к этому моменту, на всю аудиторию потенциальных пользователей. Это настоящий прыжок веры, и каждое такое действие должно быть обосновано. Внедряя решения без веских оснований, мы обязательно сделаем хоть один неверный шаг — что негативно скажется на продукте в долгосрочной перспективе. Процесс сбора таких обоснований мы называем тестированием гипотез, а искомые обоснования — статистической значимостью.

Вот несколько примеров, что тестируют посредством A/B тестов:

  • Разные типы сортировки в меню навигации сайта (как в этом примере крупного немецкого продавца электроники)
  • Лендинги (как в этом примере ведущей европейской компании по защите авиапассажиров)
  • Маркетинговые сообщения: например, рассылки или баннеры (как в этом примере международного розничного продавца натуральной косметики)

Как рождается A/B тест: Формулируем гипотезу

В основе любого A/B теста лежит проблема, которую нам надо решить, или некое поведение пользователя, которое нам нужно изменить/закрепить. Выявив проблему или задачу, маркетолог формулирует гипотезу — обоснованное предположение, которое либо подтвердится, либо опровергнется в результате эксперимента.

Пример гипотезы: Если мы добавим значок с социальным доказательством на страницу с описанием продукта, посетители узнают о популярности нашего продукта, и количество добавлений в корзину вырастет на 10%.

В этом случае, когда мы выявили проблему (низкий показатель добавлений в корзину, к примеру) и сформулировали гипотезу (отображение значка с социальным доказательством стимулирует пользователей добавлять товар в корзину чаще), можно приступать к тестированию на сайте.

Классический подход к A/B тестированию

В простом A/B тесте трафик распределяется между двумя версиями контента. Одна из версий — с оригинальным контентом и дизайном — считается контрольной. Вторая версия — это вариация. Изменения могут быть разными: к примеру, можно протестировать разные варианты заголовка, кнопки call-to-action, лейаут, дизайн и т.п.

В классическом эксперименте на уровне одной страницы, нам даже не нужно делать два URL для тестирования. Большинство решений для A/B тестирования позволяют динамически менять контент, лейаут и дизайн страницы.

Однако, если вы хотите включить в тестирование 2+ набора страниц, тогда нужно проводить сплит тестирование и использовать несколько URL.

В каких случаях проводить сплит тестирование

Сплит тестирование (иногда его называют многостраничным тестированием) в целом похоже на A/B тестирование, но позволяет проводить эксперименты с использованием отдельного URL для каждой вариации. Другими словами, сплит тестирование можно провести между двумя существующими URL-адресами, что особенно полезно, если у вас динамический контент.

Допустим, у вас уже есть два страницы, и вы хотите узнать, какая из них работает лучше. К примеру, вы запускаете рассылку и у вас есть две разные версии потенциального лендинга. Проведите сплит тестирование — и поймете, какой лендинг показывает лучшие результаты в рамках этой кампании.

В A/B тест можно включить и больше двух вариаций

Если вы хотите протестировать более двух вариаций, проведите A/B/n тест. С его помощью можно сравнить эффективность трех или более вариаций, вместо того, чтобы тестировать каждую вариацию относительно одной и той же контрольной вариации (то есть проводить цепочку независимых A/B тестов). Если на сайте высокий трафик, при помощи A/B/n тестирования можно проверять множество вариаций разом, тем самым сокращая время тестирования и получая результаты быстрее.

Однако я не рекомендую вносить слишком много изменений в вариацию. Если вы внесете только самые важные и значимые изменения, по результатам эксперимента вам будет проще понять возможные причинно-следственные связи. А если вы хотите протестировать сразу ряд изменений, проведите лучше мультивариантный тест.

Что такое мультивариантное тестирование

Мультивариантные тесты позволяют протестировать изменения сразу в нескольких разделах одной страницы. Чтобы понять принцип, проведите мультивариативный тест на одном из своих лендингов: поменяйте на нем пару элементов. В первой вариации замените главное фото на странице формы для обратной связи. Во второй вариации, добавьте на страницу видео. Теперь система сгенерирует на базе ваших изменений еще одну возможную вариацию — с видео И формой обратной связи.

Всего получится 2 x 2 = 4 вариации страницы

V1 — контрольная версия (без формы обратной связи и без видео)

V2 — вариация с формой обратной связи

V3 — вариация с видео

V4 — вариация с формой обратной связи + видео

Поскольку в ходе мультивариативного тестирования проверяются все возможные комбинации, не рекомендуем добавлять много вариантов — если только у вас не сайт с очень и очень высоким трафиком. Если проводить мультивариантное тестирование с множеством переменных на сайте с низким трафиком, есть риск получить недостаточно значимые результаты, по которым не получится сделать никакие весомые выводы. Для такого вида тестирования нужно как минимум несколько тысяч посещений в месяц.

Какой тест применить в зависимости от ситуации

A/B тест поможет найти ответы вопросы типа: “на какую из этих двух вариаций страницы посетители реагируют лучше?”

А мультивариантные тесты помогут ответить такие вопросы:

  • Посетители лучше реагируют на видео или на форму обратной связи?
  • Или лучше работает только форма обратной связи, без видео?
  • Или лучше оставить видео и убрать форму обратной связи?

Как оценить эффективность платформы для A/B тестирования

Чтобы оценить эффективность платформы для A/B тестирования, можно провести A/A тест. Для этого вам нужно создать две одинаковые версии страницы и запустить A/B тест. В идеале, система должна выдать ответ, что обе вариации показали примерно одинаковые результаты. Подробнее про A/A тесты читайте здесь.

Путь к успешным A/B тестам

“Я не провалил тест, я просто нашел 100 способов выполнить его неправильно” — Бенджамин Франклин

При проведении A/B тестирования очень важна четкая и адекватная методология. Только в этом случае мы можем доверять результатам теста и принимать эффективные решения на их основании. A/B тестирование дает нам фреймворк, который позволяет сравнить реакцию посетителей сайта на различные вариации страниц, и если одна из вариаций работает лучше — установить статистическую значимость результата и в какой-то мере причинно-следственную связь.

Если вам понравилась статья и перевод — похлопайте в знак поддержки ������

A/B тест — это просто

A/B тестирование — это мощный маркетинговый инструмент для повышения эффективности работы вашего интернет-ресурса. С помощью A/B тестов повышают конверсию посадочных страниц, подбирают оптимальные заголовки объявлений в рекламных сетях, улучшают качество поиска.

Мне часто приходится сталкиваться с задачами организации A/B тестирования в различных интернет-проектах. В этой статье хочу поделиться необходимыми базовыми знаниями для проведения тестов и анализа результатов.

Зачем нужны А/B тесты?

Итак, представим ситуацию, наш проект запущен в жизнь, на нем собирается трафик, пользователи активно используют ресурс. И в один прекрасный день мы решили что-то поменять, например, разместить всплывающий виджет для удобства подписки на новости.

Наше решение — это интуитивное предположение о том, что пользователям ресурса станет проще подписываться на новые материалы, мы ожидаем повышения числа подписчиков.

Наши предположения и гипотезы строятся на основе личного опыта и наших взглядов, которые совсем не обязательно совпадают со взглядами аудитории нашего ресурса. Другими словами, наше предположение вовсе не означает, что после внесения изменений мы получим желаемый эффект. Для проверки таких гипотез мы и проводим A/B тесты.

Как проводим тесты?

Идея A/B тестирования очень проста. Пользователи ресурса случайным образом делятся на сегменты. Один из сегментов остается без изменений — это контрольный сегмент “A”, на основе данных по этому сегменту мы будем оценивать эффект от вносимых изменений. Пользователям из сегмента “B” показываем измененную версию ресурса.

Чтобы получить статистически значимый результат, очень важно исключить влияние сегментов друг на друга, т.е. пользователь должен быть отнесен строго к одному сегменту. Это можно сделать, например, записав метку сегмента в cookies браузера.

Для снижения влияния внешних факторов, таких как рекламные кампании, день недели, погода или сезонность, замеры в сегментах важно делать параллельно, т.е. в один и тот же период времени.

Кроме того, очень важно исключить и внутренние факторы, которые также могут существенно исказить результаты теста. Таким факторами могут быть действия операторов call-центра, служба поддержки, работа редакции, разработчики или администраторы ресурса. В Google Analytics для этого можно воспользоваться фильтрами.

Число пользователей в сегментах не всегда удается сделать равным, в связи с этим метрики, как правило, выбираются относительные, т.е. без привязки к абсолютным значениям аудитории в сегменте. Нормирование осуществляется либо на число посетителей, либо на число просмотров страниц. Например, такими метриками могут быть средний чек или CTR ссылки.

Одной из причин делить аудиторию непропорционально может быть существенное изменение в интерфейсе. Например, полное обновление устаревшего дизайна сайта, изменение системы навигации или добавление всплывающей формы для сбора контактной информации. Такие изменения могут привести как к положительным, так и к отрицательным эффектам в работе ресурса.

Если есть опасение, что изменение может иметь сильное негативное влияние, например, привести к резкому оттоку аудитории, то, на первом этапе, имеет смысл тестовый сегмент делать не очень большим. В случае отсутствия негативного эффекта, размер тестового сегмента можно постепенно увеличить.

Что улучшаем?

Если вы собираетесь провести A/B тестирование на своем ресурсе, то наверняка у вашего проекта уже сформированы основные показатели, которые необходимо улучшить. Если таких показателей еще нет, тогда самое время о них задуматься.

Показатели прежде всего определяются целями проекта. Ниже приведу несколько популярных метрик, которые используются в интернет-проектах.

Конверсия

Конверсия вычисляется как доля от общего числа посетителей, совершивших какое-либо действие. Действием может быть заполнение формы на посадочной странице, совершение покупки в интернет-магазине, регистрация, подписка на новости, клик на ссылку или блок.

Экономические метрики

Как правило, эти метрики применимы для интернет-магазинов: величина среднего чека, объем выручки, отнесенный на число посетителей интернет-магазина.

Поведенческие факторы

К поведенческим факторам относят оценку заинтересованности посетителей в ресурсе. Ключевыми метриками являются: глубина просмотра страниц — число просмотренных страниц, отнесенное к числу посетителей на сайте, средняя продолжительность сессии, показатель отказов — доля пользователей, покинувших сайт сразу после первого захода, коэффициент удержания (можно считать, как 1 минус % новых пользователей).

Одного показателя не всегда достаточно для оценки эффекта от вносимых изменений. Например, после изменений на сайте интернет-магазина средний чек может уменьшиться, но общая выручка вырасти за счет повышения конверсии посетителя в покупателя. В связи с этим, важно контролировать несколько ключевых показателей.

Анализ результатов

Отлично, ключевые показатели определены, тест запущен и мы получили первые данные. В этот момент, особенно если данные соответствуют нашим ожиданиям, возникает соблазн сделать поспешные выводы о результатах тестирования.

Торопиться не стоит, значения наших ключевых показателей могут меняться день ото дня — это значит, что мы имеем дело со случайными величинами. Для сравнения случайных величин оценивают средние значения, а для оценки среднего значения требуется некоторое время, чтобы накопить историю.

Эффект от внесения изменения определяют как разность между средними значениями ключевого показателя в сегментах. Тут возникает следующий вопрос, насколько мы уверены в достоверности полученного результата? Если мы еще раз проведем тест, то какова вероятность того, что мы сможем повторить результат?

Ниже на картинках приведены примеры распределения значений показателя в сегментах.


Графики распределения характеризуют частоту появления того или иного значения случайной величины в выборке. В данном случае все значения распределены вокруг среднего.

На обеих картинках средние значения показателя в соответствующих сегментах одинаковы, картинки отличаются только разбросом значений.

Данный пример хорошо иллюстрирует, что разности средних значений недостаточно для того, чтобы считать результат достоверным, необходимо также оценить площадь пересечения распределений.

Чем меньше пересечение, тем с большей уверенностью мы можем сказать, что эффект действительно значим. Эта “уверенность” в статистике называется значимостью результата.

Как правило, для принятия положительного решения об эффективности изменений уровень значимости выбирают равным 90%, 95% или 99%. Пересечение распределений при этом равно соответственно 10%, 5% или 1%. При невысоком уровне значимости существует опасность сделать ошибочные выводы об эффекте, полученном в результате изменения.

Несмотря на важность этой характеристики, в отчетах по A/B тестам, к сожалению, часто забывают указать уровень значимости, при котором был получен результат.

Кстати, на практике примерно 8 из 10 A/B тестов не являются статистически значимыми.

Стоит отметить, что чем больше объем трафика в сегментах, тем меньше разброс среднесуточных значений показателя. При небольшом трафике из-за большего разброса значений случайной величины потребуется больше времени для проведения эксперимента, но в любом случае это лучше, чем вовсе не проводить эксперимент.

Оценить значимость результатов

Для сравнения случайных величин математики придумали целый раздел под названием проверка статистических гипотез. Гипотез всего две: “нулевая” и “альтернативная”. Нулевая гипотеза предполагает, что разница между средними значениями показателя в сегментах незначительна. Альтернативная гипотеза предполагает наличие существенной разницы между средними значениями показателя в сегментах.

Для проверки гипотез существует несколько статистических тестов. Тесты зависят от характера измеряемого показателя. В общем случае, если мы считаем среднесуточные значения, можно воспользоваться тестом Стьюдента. Этот тест хорошо зарекомендовал себя для небольших объемов данных, т.к. учитывает размер выборки при оценке значимости.

В качестве примера приведу сравнение средней длительности сессии в сегментах на одном из ресурсов, для которых я проводил эксперимент: studentttest.xls.

Тест Стьюдента — универсален, его можно применять как для измерений конверсии, так и для таких количественных показателей как средний чек, средняя глубина просмотра или время, проведенное пользователем на сайте.

В случае, если вы измеряете только конверсию, то вы имеете дело с бинарной слуайной величиной, которая принимает только два значения: посетитель “сконвертировался” и “не сконвертировался”. Для оценки статистической значимости в этом случае можно воспользоваться он-лайн калькулятором.

Инструменты

Для организации теста необходим инструмент, позволяющий разметить аудиторию по сегментам и посчитать значения ключевых показателей отдельно в каждом сегменте.

Если ваши ресурсы позволяют, то такой инструмент можно реализовать самостоятельно на основе анализа логов действий пользователей. Если ресурсы ограничены, то стоит воспользоваться сторонним инструментом. Например, в Google Analytics есть возможность задавать пользовательские сегменты.

Существует ряд сервисов, которые позволяют полностью автоматизировать процесс тестирования, например, тотже Google Analytics Experiements, примеры других сервисов можно найти в обзоре.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *