Блог
01.09.2026
Как скормить данные о посетителях ИИ и что он ответит

Есть старый приём для проверки эксперта: задайте вопрос, ответа на который заведомо не существует, и посмотрите, что человек сделает. Хороший специалист скажет «этого по таким данным не узнать». Плохой начнёт рассуждать.

Языковая модель по умолчанию ведёт себя как второй. Не потому, что врёт, а потому что её задача — продолжить текст правдоподобно. Правдоподобие и правда — разные вещи, и весь разговор о работе с данными сводится к тому, чтобы вы это различали.

Дальше практика: что у вас есть, что можно спросить, где начинается выдумка и как её ловить.

Что у вас на руках

Радар отдаёт выгрузку в CSV, по почте или через API. В таблице лежит примерно следующее: дата и час контакта, признак «прошёл мимо» или «зашёл внутрь», новый или постоянный, расстояние до устройства. Плюс обогащённые поля из Крипты — возраст, пол, города проживания, тип устройства, интересы и категории.

Одна точка собирает в среднем около 960 идентификаторов в сутки. За две недели это тринадцать тысяч строк. Человек смотрит на такое минут двадцать, устаёт и делает вывод по первому, что бросилось в глаза. Модель читает всё и не устаёт.

Персональных данных в выгрузке нет. Это важно понимать до того, как формулировать вопросы: модель не скажет вам, кто эти люди. Она скажет, какие они в массе.

Вопросы, на которые приходит рабочий ответ

Правило одно: спрашивать можно только про то, что физически лежит в таблице. Звучит банально, но нарушается постоянно.

Работают вопросы про структуру. Как меняется состав потока по часам. Чем будни отличаются от выходных. Какая доля людей появляется повторно в течение недели. В какие дни поток проседает сильнее обычного.

Работают вопросы про сравнение групп. Чем портрет вошедших отличается от портрета прошедших мимо. Есть ли разница между утренним и вечерним потоком. Похожи ли постоянные посетители на новых.

И отдельно хорошо заходит просьба найти то, чего вы не искали: «покажи три закономерности, которые я скорее всего не заметил». Человек устаёт перебирать срезы на пятом, модель — никогда. Это её честное преимущество, и именно здесь она полезнее всего.

Где начинаются галлюцинации

Галлюцинация — это ответ, который выглядит как вывод из данных, но данными не подкреплён. Модель не сигнализирует о переходе. Интонация, структура и уверенность остаются теми же, меняется только связь с реальностью.

Спросите «сколько мы заработали на этих людях» — получите ответ. С процентами, с рассуждением про конверсию, возможно даже с рекомендацией. Полностью выдуманный, потому что выручки в вашей выгрузке нет ни в каком виде.

То же с вопросами «какая реклама сработала», «почему упала выручка», «сколько из этих людей купили». Все они требуют полей, которых в таблице не существует.

Отсюда рабочее правило, которое стоит повесить над столом: если поля нет в таблице, вывод про него не считается. Проверять надо не логику ответа — с логикой у модели всё хорошо. Проверять надо источник каждого числа.

Практический приём: попросите модель после каждого вывода указывать, из каких именно колонок он получен. Выводы, под которыми окажется пусто, отбрасывайте не глядя.

Про долю матчинга скажите модели прямо

Тонкость, которую упускают почти все. В Крипте матчится до 30% собранных идентификаторов. Значит, обогащённые поля — возраст, интересы, города — заполнены не у всех строк, а у меньшей части.

Модель об этом не знает. Если не предупредить, она будет рассуждать про весь поток, опираясь на треть. Формулируйте прямо: «поля возраста и интересов заполнены примерно у 30% строк, учитывай это в выводах и не экстраполируй на весь массив».

Разница в ответах после такой оговорки заметная. Это одна строка в запросе, которая экономит вам неверное решение.

Как встроить это в работу, а не в развлечение

Разовый эксперимент ничего не даёт. Работает регулярность: раз в месяц выгружаете данные, задаёте один и тот же набор вопросов, ответы складываете рядом.

Ценность появляется не с первой выгрузки, а примерно с третьей, когда видна динамика. Один срез отвечает на вопрос «как есть». Три среза подряд отвечают на вопрос «куда идёт», а это уже другой класс решений.

Связка с рекламой прямее: сегменты выгружаются в Яндекс Директ и VK Рекламу вручную или по расписанию, а модель помогает решить, какой сегмент брать и что ему писать.

Где всё это ломается

На малом потоке. Полсотни человек в день — это не данные, это анекдот. Модель добросовестно найдёт закономерности и в анекдоте, и они будут выглядеть убедительно.

На коротком окне. Три дня наблюдений дадут выводы про эти три дня, а прозвучат они как выводы про ваш бизнес.

И общее ограничение, которое никуда не денется: радар видит присутствие, а не покупку. Любой ответ модели про деньги — это ваша гипотеза, а не факт, пока вы не свели данные с кассой.

Скажу спорное. Большинство людей задают модели вопросы, ответы на которые уже знают, и радуются совпадению. Пользы в этом ноль, это самоподтверждение. Ценность начинается ровно там, где вы просите показать то, чего не ожидали увидеть, — и готовы к тому, что увиденное вам не понравится.

Что дальше

Мы разобрали, как разговаривать с моделью о данных. Остался вопрос, который я обошёл: какие именно сегменты имеет смысл выгружать в рекламный кабинет, чтобы не платить за показы тем, кто и так к вам ходит. Там своя арифметика, и она неочевидная.

Посмотреть на живых данных

Демо-кабинет открыт без регистрации: cp.wifiradar.ru/radar, логин и пароль wifiradar_demo. Оттуда видно, как устроена выгрузка и какие поля в ней реально заполнены.

Как работает сбор — на странице продукта. Разборы внедрений с цифрами — в кейсах.