LLMCaseLLMCase
Новости Внедрение ИИ

Хватило просьбы пересказать страницу — и чат отдал имя, город и вопросы пользователя

Коротко

Дальше ассистент сам собрал данные в адрес ссылки и сам её открыл, без подтверждения и предупреждения. Разработчика уведомили 3 июня, на 20 августа он не назвал сроков исправления и публично не высказался. Ни номера уязвимости, ни исправления, ни случаев использования в реальных атаках нет. Исследование выполнила компания, которая продаёт тестирование ИИ на прочность.

Приём, который показала компания Adversa AI, устроен обманчиво просто. На веб-странице лежит зашифрованный кусок с вредоносными инструкциями, а рядом, открытым текстом, — ключ и просьба его расшифровать. Пользователь делает совершенно обычную вещь: просит ассистента пересказать страницу.

Дальше происходит вот что. Фильтр, который проверяет содержимое, шифр прочитать не может — расшифровка требует вычислений, которых он не делает. А модель расшифровывает своим же исполнением кода. И теперь инструкции появляются перед ней не как чужой текст с внешней страницы, а как результат кода, который она сама только что выполнила, — то есть в доверенном контексте. Формулировка исследователей: расшифрованные инструкции «не помечаются как недоверенный ввод».

Что было дальше в демонстрации. Ассистент собрал имя пользователя, приблизительное местоположение, тариф подписки и все вопросы, заданные в текущем разговоре, подставил это в адрес ссылки и сам её открыл своим же инструментом навигации — данные оказались в журналах атакующего. Без подтверждения и без предупреждения.

3 июня
разработчика уведомили
20 августа
атака всё ещё воспроизводилась
0
номер уязвимости, исправление, случаи в реальных атаках

Теперь честные границы, потому что заголовки эту историю уже успели раздуть.

Первое: утекает не «вся переписка». Исследователи прямо говорят, что всё извлечённое уже находилось в контексте модели, а проверять доступ к другим чатам и к памяти агента они не пробовали.

Второе: почему те же инструкции открытым текстом модель отклоняет, а зашифрованные выполняет — точно не установлено. Ведущая гипотеза самих исследователей: фильтр смотрит текст на входе и выходе, но не смотрит на результат кода, который модель выполнила сама.

Третье: успех 40% на двадцати попытках с июня — эту цифру Adversa назвала журналистам, в самом отчёте её нет.

Четвёртое, и главное: Adversa продаёт тестирование ИИ на прочность, а её отчёт заканчивается рекомендациями, совпадающими с её же услугами. Разработчик, которого уведомили 3 июня и повторно в августе, публично не высказался и сроков не назвал. Так что корректно говорить «в демонстрации утекло», а не «сервис сливает данные».

За два дня до этого другая команда другим приёмом того же класса заставила корпоративного ассистента Microsoft искать в почтовом ящике пароли и отправлять найденное наружу. Там разработчик отреагировал: поблагодарил исследователей и заявил, что клиенты защищены без действий с их стороны.

Источник: Adversa AI
AI-разбор за 30 секунд
Сверим вашу нишу с внедрениями ИИ в похожие компании и покажем, где утекают заявки — за 30 секунд.
Пройти AI-разбор →
Дмитрий Кайгородов

Основатель LLMCase, делаю AI-driven маркетинг для B2B SaaS и EdTech. Подробнее об авторе →