Когда ИИ-агент работает плохо или дорого, первое желание — сменить модель на более сильную. За последний месяц вышли четыре независимых замера, которые говорят, что это не первый шаг, а последний.
Самый прямой по деньгам — у Databricks. Компания прогнала агентов по своей кодовой базе в несколько миллионов строк и опубликовала результат: при одной и той же модели стоимость решения задачи различалась более чем в два раза, а качество оставалось тем же. Вся разница — в том, сколько контекста каждая обвязка подаёт модели на каждом шаге. Формулировка гендиректора компании Али Гходси: «Можно взять одну и ту же модель, но разные обвязки — и с неправильной вы платите значительно больше. Само это может удвоить ваши расходы».
Второй замер — от самой OpenAI, и он про качество. На тесте ARC-AGI-3, который проверяет способность агента разбираться в незнакомой среде, её флагманская модель со стандартной обвязкой набрала 13,3%. После включения двух настроек собственного интерфейса — сохранения рассуждений между шагами и сжатия контекста — результат стал 38,3%, то есть утроился, а расход исходящих токенов упал в шесть раз. Модель при этом не менялась.
Третий замер объясняет, где именно всё ломается на длинной дистанции. Microsoft Research собрала бенчмарк из 310 рабочих сред в 52 профессиональных областях и прогнала 19 моделей через цепочки из десяти последовательных задач с документами. Итог: даже передовые модели к концу длинной цепочки портят в среднем четверть содержимого документа. Причём ошибки авторы описывают как «редкие, но тяжёлые и незаметные» — они накапливаются молча, и в конце вы получаете документ, который выглядит нормально, а внутри неверен.
Четвёртый сюжет — про то, что грамотная обвязка вытягивает результат до максимума. На том же тесте ARC-AGI-3 сразу три команды, включая исследователей MIT, довели до 100% модель, у которой в официальном рейтинге стоит 30,2%. Здесь важна оговорка, без которой цифры вводят в заблуждение: 100% получены на публичном наборе задач, который организаторы теста принципиально не проверяют — результаты там заявляют сами участники. И это не измерение одной модели в двух конфигурациях: настройки, агентная система и методика прогонов различались. Так что читать это надо не как «обвязка добавляет 70 процентных пунктов», а как «потолок модели заметно выше того, что она показывает сама по себе».
Что вообще входит в эту обвязку, если по-простому. Память: помнит ли агент, что делал на предыдущих шагах, или каждый раз начинает заново. Инструменты: чем он умеет пользоваться и как ему описали, когда что применять. Контекст: сколько лишнего ему подают на каждом шаге — за это платят токенами. И контроль: есть ли кто-то, кто заметит, что агент ходит по кругу, и развернёт его. В одном из проектов роль такого контролёра описали как «почти начальник, который подталкивает агента, когда тот уходит не туда».