← Все записи
Среда выполнения ИИ

Автономным ИИ-агентам нужна среда выполнения

Большинство агентов — это демо. Реальная работа требует среды выполнения, где агенты воспринимают, планируют, действуют и оцениваются.

Цикл Algenta: воспринимать, планировать, выполнять, оценивать.
Цикл Algenta: воспринимать, планировать, выполнять, оценивать.

Демо всегда работает. Агент читает заявку, составляет ответ, оформляет возврат и закрывает цикл под одобрительные кивки. Потом он выходит в продакшн, встречает тысячи новых случаев и начинает возвращать деньги за заказы, которых никогда не было.

В демо не было лжи. Не было всего того, что делает тысячи реальных случаев управляемыми, — той части, которую никто не снимает. Автономные ИИ-агенты несложно запустить. Сложно удержать их в рамках.

Демо — это не система

Модель, способная вызвать инструмент, — это возможность. Система, которая вызывает нужный инструмент, в нужный момент, с нужным состоянием, и может объяснить почему — это инфраструктура. Расстояние между ними не преодолевается лучшим промптом.

В демо агент запускается один раз, под наблюдением, по счастливому сценарию. В продакшне он запускается десятки тысяч раз, без наблюдения, в условиях состояния, которое меняется между моментом чтения и моментом действия. Память устарела или отсутствует. Повторная попытка списывает деньги дважды. Вызов инструмента, который следовало заблокировать, проходит — потому что никто не стоял у двери.

Это не сбои модели. Это сбои, которые должна поглощать среда выполнения. Воспринимать их как проблемы промптов — значит тратить квартал на переформулировку инструкций и всё равно не уметь ответить на единственный вопрос, который важен при разборе инцидента: что сделал агент и на каком основании.

Цикл, который автономные ИИ-агенты выполняют на самом деле

Algenta — это среда выполнения ИИ-агентов, построенная вокруг единого цикла, который выполняет каждый агент, независимо от того, назвали ли его авторы этот цикл явно. Сделать цикл явным — это большая часть работы.

  • Воспринимать — читать текущее состояние мира: входные данные, извлечённую память, актуальные значения, от которых зависит решение.
  • Планировать — определять следующее действие или несколько, исходя из этого состояния и цели.
  • Выполнять — действовать через управляемые инструменты, где каждый вызов проверяется на соответствие политике до того, как коснётся чего-либо реального.
  • Оценивать — сопоставлять произошедшее с ожиданиями и возвращать это суждение в память и следующий план.

Воспринимать, планировать, выполнять, оценивать. Шаги очевидны; дисциплина — в том, чтобы не пропускать последний. Большинство фреймворков для агентов останавливаются на выполнении — именно поэтому они хорошо смотрятся в демо и плохо стареют: они действуют, не получая оценки, и ошибка накапливается молча, вместо того чтобы быть поймана в момент возникновения.

Вокруг цикла расположены общие примитивы, которые вся среда выполнения рассматривает как первоклассные элементы, а не надстройки: память, которую агент читает и пишет; инструменты, через которые он действует; политика, управляющая каждым действием; трассировки, фиксирующие произошедшее; и оценки, определяющие, было ли оно верным. Каждый шаг цикла взаимодействует с каждым примитивом. Память питает восприятие и обновляется оценкой. Политика контролирует выполнение. Трассировки охватывают все четыре шага, чтобы оценка имела честную основу.

Агент, которого нельзя оценить, — не автономный. Он бесконтрольный.

Почему скучные примитивы и есть продукт

Память, политика, трассировки, оценки. Ничто из этого не выглядит эффектно. Всё это отделяет агента, работающего в комнате, от агента, работающего в мире.

Память позволяет агенту действовать на основе того, что он знал секунду назад, а не заново открывать мир при каждом вызове — и среда выполнения должна проводить границу между устойчивыми знаниями и рабочим пространством одного запуска, потому что их смешение — это путь к тому, что агент начинает доверять собственным галлюцинациям. Политика — это разница между инструментом, который агент может вызвать, и тем, который ему разрешено вызвать прямо сейчас, с учётом того, в чьих интересах он действует и что уже сделал за этот час. Трассировки превращают «агент сделал что-то странное» в конкретное решение, на конкретном входе, с конкретным контекстом — разница между отладкой и догадками.

Оценки — это примитив, который команды обнаруживают последним, а нужен он первым. Без них «агент работает» означает «никто ещё не пожаловался громко». С ними каждый запуск получает оценку — по эталону там, где он есть, по правилам и критериям там, где его нет — и регрессия проявляется как изменившееся число, на изменении, которое его вызвало, до того как это достигнет клиента.

Оркестрация — средство, а не цель

Оркестрация агентов привлекает большую часть внимания: граф шагов, повторные попытки, передача управления между агентами и субагентами. Это важно. Но оркестрация без управления — лишь более быстрый способ делать неправильное в масштабе, а оркестрация без оценки — более быстрый способ делать это незаметно.

Algenta рассматривает оркестрацию как один из слоёв среды выполнения ИИ-агентов, а не как её суть. План может ветвиться, вызывать других агентов, запускать симуляцию для проверки действия перед фиксацией и ждать человека, когда этого требует политика — и каждый из этих шагов попадает в ту же трассировку, управляется той же политикой, оценивается теми же оценками. Оркестрация решает, что происходит дальше. Среда выполнения решает, разрешено ли это, и было ли это верным.

В этом — негромкое утверждение платформы среды выполнения ИИ-агентов: восприятие, планирование, действие и оценка не должны собираться вручную каждой командой, которая хочет агента в продакшне. Это инфраструктура. На неё можно полагаться так же, как на надёжность базы данных.

Что меняется, когда цикл замкнут

Когда полный цикл работает — когда оценка не является запоздалой мыслью, а четвёртым тактом каждого цикла — характер работы меняется. Автономные ИИ-агенты перестают быть тем, что запускают и надеются на лучшее, и становятся тем, чем можно управлять: наблюдать, ограничивать, корректировать и доверять в заявленных пределах.

Это и есть граница между демо и операционным интеллектом. Демо просит верить. Среда выполнения позволяет проверять. Команды, которые будут запускать автономных ИИ-агентов в масштабе, — это те, кто решает заранее, что скучные примитивы и есть продукт, и что агент, которого нельзя оценить, не получает права действовать бесконтрольно.

Получать обновления →