Приём, который показала компания Adversa AI, устроен обманчиво просто. На веб-странице лежит зашифрованный кусок с вредоносными инструкциями, а рядом, открытым текстом, — ключ и просьба его расшифровать. Пользователь делает совершенно обычную вещь: просит ассистента пересказать страницу.
Дальше происходит вот что. Фильтр, который проверяет содержимое, шифр прочитать не может — расшифровка требует вычислений, которых он не делает. А модель расшифровывает своим же исполнением кода. И теперь инструкции появляются перед ней не как чужой текст с внешней страницы, а как результат кода, который она сама только что выполнила, — то есть в доверенном контексте. Формулировка исследователей: расшифрованные инструкции «не помечаются как недоверенный ввод».
Что было дальше в демонстрации. Ассистент собрал имя пользователя, приблизительное местоположение, тариф подписки и все вопросы, заданные в текущем разговоре, подставил это в адрес ссылки и сам её открыл своим же инструментом навигации — данные оказались в журналах атакующего. Без подтверждения и без предупреждения.
Теперь честные границы, потому что заголовки эту историю уже успели раздуть.
Первое: утекает не «вся переписка». Исследователи прямо говорят, что всё извлечённое уже находилось в контексте модели, а проверять доступ к другим чатам и к памяти агента они не пробовали.
Второе: почему те же инструкции открытым текстом модель отклоняет, а зашифрованные выполняет — точно не установлено. Ведущая гипотеза самих исследователей: фильтр смотрит текст на входе и выходе, но не смотрит на результат кода, который модель выполнила сама.
Третье: успех 40% на двадцати попытках с июня — эту цифру Adversa назвала журналистам, в самом отчёте её нет.
Четвёртое, и главное: Adversa продаёт тестирование ИИ на прочность, а её отчёт заканчивается рекомендациями, совпадающими с её же услугами. Разработчик, которого уведомили 3 июня и повторно в августе, публично не высказался и сроков не назвал. Так что корректно говорить «в демонстрации утекло», а не «сервис сливает данные».
За два дня до этого другая команда другим приёмом того же класса заставила корпоративного ассистента Microsoft искать в почтовом ящике пароли и отправлять найденное наружу. Там разработчик отреагировал: поблагодарил исследователей и заявил, что клиенты защищены без действий с их стороны.