Атака GhostWriter отравляет память ИИ-агента: чужие команды срабатывают в 98% случаев
Новости·20 июля 2026·3 мин чтения
Коротко
Учёные из Университета штата Нью-Мексико показали атаку GhostWriter на ИИ-агентов с долговременной памятью. Схема из двух шагов: злоумышленник тайно записывает скрытую инструкцию в память агента, а позже она активируется при обычном запросе пользователя — и агент может, например, переслать письма на чужой ящик. Внедрение срабатывает почти в 98% случаев. Вывод для бизнеса: у ИИ-ботов с памятью нужно спрашивать про защиту этой памяти.
Исследователи из Университета штата Нью-Мексико (Джордж Торрес, Шарад Шрестха и Сатьяжайант Мисра) описали в препринте на arXiv атаку GhostWriter на ИИ-агентов с долговременной памятью. Работает она в два шага. Сначала злоумышленник отправляет агенту сообщение со скрытой инструкцией — она незаметно оседает в памяти как обычная запись. Позже пользователь даёт агенту легитимную задачу (например, «найди адрес почты»), агент читает память, натыкается на отравленную запись и выполняет вредоносную команду — скажем, пересылает письма из банка на посторонний ящик.
По данным авторов, на современных агентах внедрение записи в память срабатывает почти в 98% случаев, а её активация при обычной задаче — в среднем в 60%. Главная проблема: память агентов почти не защищена — нет фильтра, который проверял бы, что именно туда пишут.
~98%
успех внедрения инструкции в память агента
~60%
средняя частота её активации при обычной задаче
Исследователи предложили защиту AM-Sentry (контроль записи в память плюс фильтр при извлечении), которая резко снижает успех атаки, не ломая полезные функции. Подробнее — в разборе «Хайтека».