Переход с последнего клика на модель атрибуции по данным считается признаком зрелости. На практике у большинства компаний такая модель обучается на выборке, недостаточной для устойчивых выводов, — и даёт уверенность там, где её быть не должно.
Что должно совпасть, чтобы модель работала
Алгоритмическая атрибуция ищет закономерность в последовательностях касаний перед конверсией. Чтобы закономерность отделилась от шума, нужны три вещи одновременно: достаточное число конверсий, разнообразие путей и стабильность разметки на всём периоде обучения.
По первому пункту ориентир простой: несколько тысяч конверсий в месяц на каждый значимый канал. Не суммарно — на канал. Компания с двумястами сделками в месяц получит модель, которая перераспределяет вес между каналами при каждом пересчёте, и это будет выглядеть как «динамика».
Второй пункт хуже поддаётся проверке. Если восемьдесят процентов конверсий приходят по пути «брендовый поиск → сайт → заявка», модели просто не на чем учиться: разнообразия нет, и она честно скажет, что почти весь вклад у брендового поиска. Это верно арифметически и бесполезно управленчески.
Как проверить свою модель за один вечер
Возьмите три соседних месяца и сравните распределение вклада по каналам. Если веса скачут более чем на десять процентных пунктов при сопоставимой структуре трафика — модель ловит шум. Второй тест: постройте ту же модель на случайной половине данных и на второй половине. Расхождение результатов говорит само за себя.
Третий, самый неприятный тест: выключите один канал в одном регионе на три недели и посмотрите, изменилась ли выручка так, как предсказывала модель. В нашей практике совпадение наступает примерно в половине случаев.
Для большинства российских компаний data-driven атрибуция статистически не обучается. Последний клик с честными оговорками полезнее плохой модели, потому что все понимают его ограничения.
Артём Гордеев, управляющий партнёр Блэкпайн Лаб
Что делать, если данных не хватает
Работающая альтернатива — не другая модель, а эксперимент. Инкрементальные тесты отвечают на вопрос «что изменится, если убрать канал», а не «кому приписать заслугу». Geo-holdout, при котором канал отключается в сопоставимых регионах, даёт ответ за три-четыре недели и не требует объёма данных для обучения.
Второй инструмент — моделирование медиамикса на агрегированных данных. Оно не даёт пользовательских путей, зато работает на недельных срезах и переживает потерю идентификаторов.
Третий, самый недооценённый, — прямой вопрос покупателю в момент оформления заказа. Данные будут смещёнными, но смещение известное и стабильное, а это уже пригодно для сравнения периодов.
Что забрать в работу
- Проверьте стабильность текущей модели на соседних периодах, прежде чем принимать по ней бюджетные решения.
- Заложите бюджет на один инкрементальный тест в квартал — это дешевле, чем год ошибочного распределения.
- Вынесите брендовый трафик в отдельную строку отчёта. Без этого любая модель будет вводить в заблуждение.
- Договоритесь о горизонте оценки до старта: три месяца — не срок для решений, меняющих структуру спроса.
4 комментария
Обсуждение ведут участники клуба. Редакция модерирует ветки.
Тест «постройте модель на двух половинах данных» стоит того, чтобы вынести его в отдельную инструкцию. У нас после него закрылась дискуссия, которая шла полгода.
Про порог в 2000 конверсий на канал — цифра спорная, зависит от длины пути. Но как ориентир для разговора с руководством работает.
Отдельная строка под брендовый трафик — единственное, что реально меняет картину. Всё остальное косметика поверх этого.
В B2B с циклом в полтора года любые модели атрибуции — фикция. Там честнее опрос и качественные интервью, о чём вы почти не пишете.
Обсуждение закрыто.
Комментарии доступны участникам клуба.
Вступить в клуб Войти