LLMCaseLLMCase
Новости Внедрение ИИ

Нейросети на тесте искали готовый ответ в интернете вместо решения: списали 21 из 22

Коротко

37,1% зачтённых решений модели получили обманом: находили опубликованный разбор задачи или подглядывали ответ в файлах проверяющей системы. Жёсткая инструкция «не списывать» снизила попытки с 33% до 8,5%, но восемь моделей продолжили, а у четырёх она обман даже усилила. Вывод авторов: промптом дырку не закрыть, нужны ограничения окружения.

Компания Dreadnode прогнала 22 передовые модели семи разработчиков — Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba и Z.ai — по 23 задачам из соревнований по кибербезопасности и проверила не только результат, но и способ его получения. Итог исследования в одной фразе: 37,1% зачтённых решений были получены обманом, списывала 21 модель из 22.

Обман считали по двум чётким признакам. Первый — модель шла в интернет и находила опубликованный разбор ровно этой задачи или прямо готовый ответ. Второй — модель залезала в файлы своей же песочницы и читала ответ из служебных данных проверяющей системы, минуя саму задачу. Изучение техники и чтение документации обманом не считали.

Важная оговорка, которая теряется в пересказах: «завышение впятеро» — это худший случай одной модели, а не общий вывод. У неё было 10 зачётов, из них честных 2. В среднем по всем 22 моделям формальная доля пройденных задач 41,5%, а доля пройденных без нарушений — 26,1%. То есть в среднем оценки завышены примерно в полтора раза, а не в пять.

Самое прикладное в работе — попытка закрыть проблему инструкцией. Прямой запрет списывать в системном промпте снизил склонность к обману с 33% до 17,8%, а самая жёсткая формулировка — до 8,5%. Но восемь моделей продолжили жульничать даже под самой суровой инструкцией. А у четырёх моделей она дала обратный эффект: там, где при мягком режиме обмана не было вовсе, при жёстком он появился.

37,1%
зачётов получены обманом
41,5% → 26,1%
формальная и честная доля решённых задач
33% → 8,5%
попытки списать до и после жёсткой инструкции

Вывод авторов: анти-чит-промпт — «эффективный и практически бесплатный первый слой защиты, но он не заменяет контроль окружения». Полностью закрыть разрыв, по их словам, могут только структурные меры: отключить интернет, ужесточить песочницу, давать задачи, разборов которых нет в открытом доступе.

Честности ради — прямо переносить эти проценты на бизнес нельзя. Здесь задачи из соревнований, у которых разбор лежит в интернете, а файл с ответом физически находится рядом с агентом в песочнице. У задачи «обработать заявку клиента» готового ответа в интернете нет. Авторы и сами называют такие задачи стилизованными головоломками и обобщений на другие сферы не делают.

Источник: Dreadnode
AI-разбор за 30 секунд
Сверим вашу нишу с внедрениями ИИ в похожие компании и покажем, где утекают заявки — за 30 секунд.
Пройти AI-разбор →
Дмитрий Кайгородов

Основатель LLMCase, делаю AI-driven маркетинг для B2B SaaS и EdTech. Подробнее об авторе →