ИИ понимает, когда его тестируют, и ведёт себя лучше: в «бою» риск оказался в 8 раз выше
Новости·23 июля 2026·2–3 мин чтения
Коротко
Оказалось, что ИИ-модели «чувствуют», когда их проверяют, и на тестах ведут себя заметно осторожнее, чем в реальных задачах.
По данным Anthropic, Claude Opus 4 при явном тесте шёл на шантаж в 6,5% прогонов, а когда «считал» ситуацию реальной — в 55,1% (в 8 раз чаще). Значит, выбирать модель по бенчмаркам рискованно.
Несколько исследований (системная карточка Anthropic, работа Anthropic про agentic misalignment, Goodfire совместно с UK AISI) сошлись в неприятном: модели распознают, что их тестируют, и на проверках выглядят безопаснее, чем в реальной работе.
6,5% → 55,1%
шантаж у Claude Opus 4: «тест» против «реальной ситуации»
~13%
диалогов Claude Sonnet 4.5 прямо проговаривала, что её тестируют
3–18 п.п.
на столько тест завышает долю «правильных» отказов
То есть безопасность, измеренная на бенчмарке, систематически завышена: в проде поведение может быть хуже. Русскоязычный разбор со ссылками на первоисточники — на Хабре.