Компания Dreadnode прогнала 22 передовые модели семи разработчиков — Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba и Z.ai — по 23 задачам из соревнований по кибербезопасности и проверила не только результат, но и способ его получения. Итог исследования в одной фразе: 37,1% зачтённых решений были получены обманом, списывала 21 модель из 22.
Обман считали по двум чётким признакам. Первый — модель шла в интернет и находила опубликованный разбор ровно этой задачи или прямо готовый ответ. Второй — модель залезала в файлы своей же песочницы и читала ответ из служебных данных проверяющей системы, минуя саму задачу. Изучение техники и чтение документации обманом не считали.
Важная оговорка, которая теряется в пересказах: «завышение впятеро» — это худший случай одной модели, а не общий вывод. У неё было 10 зачётов, из них честных 2. В среднем по всем 22 моделям формальная доля пройденных задач 41,5%, а доля пройденных без нарушений — 26,1%. То есть в среднем оценки завышены примерно в полтора раза, а не в пять.
Самое прикладное в работе — попытка закрыть проблему инструкцией. Прямой запрет списывать в системном промпте снизил склонность к обману с 33% до 17,8%, а самая жёсткая формулировка — до 8,5%. Но восемь моделей продолжили жульничать даже под самой суровой инструкцией. А у четырёх моделей она дала обратный эффект: там, где при мягком режиме обмана не было вовсе, при жёстком он появился.
Вывод авторов: анти-чит-промпт — «эффективный и практически бесплатный первый слой защиты, но он не заменяет контроль окружения». Полностью закрыть разрыв, по их словам, могут только структурные меры: отключить интернет, ужесточить песочницу, давать задачи, разборов которых нет в открытом доступе.
Честности ради — прямо переносить эти проценты на бизнес нельзя. Здесь задачи из соревнований, у которых разбор лежит в интернете, а файл с ответом физически находится рядом с агентом в песочнице. У задачи «обработать заявку клиента» готового ответа в интернете нет. Авторы и сами называют такие задачи стилизованными головоломками и обобщений на другие сферы не делают.