LLMCaseLLMCase
Новости Кейсы рынка

Семь советов по попаданию в ответы нейросетей проверили на 73 страницах — не сработал ни один

Коротко

Ключ в заголовке, разметка, блок вопросов-ответов, свежая дата, чистый адрес — по всем этим признакам цитируемые и разово процитированные страницы не отличаются. Зато видно другое: нейросети тянули не сайты компаний, а сторонние обзоры и рейтинги про этот рынок. Выборка маленькая, и автор сам это подчёркивает.

Автор эксперимента взял шесть моделей — ChatGPT, Claude, Perplexity, Gemini, GigaChat и «Алису AI», — задал по семь запросов про выбор подрядчика, каждый по три раза, и собрал все адреса, которые модели показали в источниках. Из 199 ссылок живыми оказались 73 страницы. Дальше он разделил их на две группы: 34 страницы процитировали минимум две разные модели, 39 — ровно одна. И сравнил группы по семи пунктам стандартного чек-листа. Разбор опубликован на Хабре.

Ни один пункт групп не различил. Ключевое слово в главном заголовке: 94% против 82%. Ключ в заголовке вкладки: 97% против 87%. Видимая дата: 59% против 51%. Блок вопросов и ответов: 76% против 79% — то есть у страниц, процитированных один раз, он встречался даже чаще. Разметка для поисковиков: 85% против 69%. Понятный адрес без мусора: 100% против 92%. Ни одна разница не прошла проверку на случайность.

По объёму и структуре результат вообще противоположен советам. У часто цитируемых страниц текст короче (медиана 17,4 тысячи знаков против 18 тысяч), подзаголовков меньше, пунктов в списках меньше (65 против 78), таблицы встречаются реже (21% против 31%).

Единственный признак, который дал разницу, автор добавил сам: видимая подпись автора на странице. У всех 34 часто цитируемых она есть, у разово процитированных — у 32 из 39. И он же первым эту находку и разбирает: при семи проверках подряд порог значимости надо ужесточать, и его результат этого порога не проходит. Плюс, пишет он, совпадение не означает причину: чтобы проверить, нужен другой опыт — взять страницы без подписи, половине добавить её и больше ничего не менять.

73
страницы в разборе (34 против 39)
0 из 7
пунктов чек-листа различили группы
27
упоминаний одного стороннего рейтинга у 4 моделей

Самое полезное в работе — не про чек-лист. Чаще всего модели цитировали вообще не сайты компаний, а чужие тексты про этот рынок: независимый рейтинг на dtf.ru — 27 упоминаний у четырёх моделей, обзор двенадцати агентств на vc.ru — 25 у четырёх, подборку на sostav.ru — 24 у трёх. Формулировка автора: цитируется не столько сама компания, сколько сторонний текст о рынке компаний.

Ограничения автор перечисляет сам, и их надо держать в голове. Выборка маленькая: разницу меньше 15 процентных пунктов на 34 и 39 страницах просто не видно, так что часть пунктов могла работать, а эксперимент этого не поймал. Ниша одна, перенос на другие рынки не проверялся. Страницы качались без выполнения скриптов, поэтому у сайтов на современных фреймворках разметка, подпись автора и блок вопросов могли быть, но в замер не попасть. И контрольной группы в строгом смысле здесь нет: «разовые» страницы — тоже процитированные, просто один раз.

Источник: Хабр
AI-разбор за 30 секунд
Сверим вашу нишу с внедрениями ИИ в похожие компании и покажем, где утекают заявки — за 30 секунд.
Пройти AI-разбор →
Дмитрий Кайгородов

Основатель LLMCase, делаю AI-driven маркетинг для B2B SaaS и EdTech. Подробнее об авторе →