デモは必ずうまくいく。エージェントはチケットを読み、返信を下書きし、返金を処理し、ループを閉じる——部屋の全員がうなずく中で。そして本番に出て、2000件目以降のケースに直面し、存在しない注文への返金を始める。
デモに嘘はなかった。欠けていたのは、2000件目以降を乗り越えるために必要なすべて——誰も撮影しない部分だ。自律型AIエージェントを動かし始めることは難しくない。誠実に動かし続けることが難しい。
デモはシステムではない
ツールを呼び出せるモデルは能力だ。適切なツールを、適切なタイミングで、適切な状態に対して呼び出し、その理由を後から説明できるシステム——それがインフラだ。両者の距離は、より良いプロンプトでは埋まらない。
デモでは、エージェントは一度だけ、監視下で、ハッピーパスを走る。本番では1万回、監視なしで、読み取った瞬間と行動する瞬間の間にドリフトする状態に対して走る。メモリは陳腐化しているか、存在しない。リトライされたステップが二重請求を引き起こす。拒否されるべきツール呼び出しが通ってしまう——門番が誰もいないから。
これらはモデルの失敗ではない。ランタイムが吸収すべき失敗だ。プロンプトの問題として扱うことで、チームは四半期を指示の言い換えに費やし、それでもインシデントレビューで唯一重要な問いに答えられない——エージェントは何をしたのか、そしてその根拠は何か。
自律型AIエージェントが実際に走るループ
Algentaは、すべてのエージェントが——その作者が名付けたかどうかにかかわらず——走る単一のループを中心に構築されたAIエージェントランタイムだ。ループを明示することが、作業の大半を占める。
- 感知 — 世界の現在の状態を読む:入力、取得されたメモリ、意思決定が依存するライブの値。
- 計画 — その状態とゴールを踏まえ、次のアクション、あるいは次のいくつかのアクションを決定する。
- 実行 — 管理されたツールを通じて行動する。各呼び出しは実際に何かに触れる前にポリシーに照らして検証される。
- 評価 — 起きたことを期待値と照らして判断し、その判断をメモリと次の計画にフィードバックする。
感知、計画、実行、評価。ステップは自明だ。規律は最後のステップを省かないことにある。多くのエージェントフレームワークは実行で止まる——だからこそデモでは映え、時間とともに劣化する。採点されることなく行動し続けるため、エラーは発生したターンで捕捉されるのではなく、静かに積み重なっていく。
ループの周囲には、ランタイム全体がボルトオンではなくファーストクラスとして扱う共有プリミティブが存在する:エージェントが読み書きするメモリ、行動するためのツール、すべてのアクションを管理するポリシー、何が起きたかを記録するトレース、そして良否を判断する評価。ループの各ステップは各プリミティブに触れる。メモリは感知を支え、評価によって更新される。ポリシーは実行を制御する。トレースは4つすべてを捕捉し、評価が誠実に採点できる素材を提供する。
採点できないエージェントは自律的ではない。監視されていないだけだ。
地味なプリミティブこそがプロダクトである理由
メモリ、ポリシー、トレース、評価。どれも写真映えしない。しかしそのすべてが、部屋の中で機能するエージェントと、世界の中で機能するエージェントを分かつものだ。
メモリは、エージェントが毎回世界を再発見するのではなく、1秒前に知っていたことに基づいて行動できるようにする——そしてランタイムは、永続的な知識と単一実行のスクラッチスペースの境界を引かなければならない。それを混同することで、エージェントは自分自身のハルシネーションを信頼し始める。ポリシーは、エージェントが呼び出せるツールと、今この瞬間、誰のために行動しているか、この1時間に何をすでに行ったかを踏まえて呼び出しを許可されたツールの差だ。トレースは「エージェントが何かおかしなことをした」を、特定の入力に対する特定の決定と、その時点での具体的なコンテキストに変える——デバッグと推測の差だ。
評価は、チームが最後に発見し、最初に必要とするプリミティブだ。それなしでは、「エージェントは機能している」は「まだ誰も大きな声で不満を言っていない」を意味する。それがあれば、すべての実行が採点される——根拠となる正解が存在する場合はそれに対して、存在しない場合はルールとルーブリックに対して——そして回帰は、それを引き起こした変更の上で、顧客に届く前に、動いた数値として現れる。
オーケストレーションは手段であり、目的ではない
エージェントのオーケストレーションは注目を集めやすい——ステップのグラフ、リトライ、エージェントとサブエージェント間のハンドオフ。それは重要だ。しかしガバナンスのないオーケストレーションは、誤ったことをスケールで速くやる手段に過ぎず、評価のないオーケストレーションは、それに気づかずに速くやる手段に過ぎない。
Algentaはオーケストレーションを、AIエージェントランタイム環境の一層として扱う——その全体としてではなく。計画は分岐し、他のエージェントを呼び出し、コミットする前にアクションをテストするシミュレーションを実行し、ポリシーが要求するときは人間を待つことができる——そしてそれらの動きのすべてが、同じトレースに記録され、同じポリシーに管理され、同じ評価で採点される。オーケストレーションは次に何が起きるかを決める。ランタイムは、それが許可されているか、そして正しかったかを決める。
これがAIエージェントランタイムプラットフォームの背後にある静かな主張だ:感知、計画、行動、判断は、エージェントを本番に投入したいすべてのチームが手作業で組み立て直すべきものではない。それらはインフラだ。データベースが永続的であることを前提にできるように、前提にできるべきものだ。
ループが閉じられたとき何が変わるか
完全なループが走るとき——評価が後付けではなく、すべてのサイクルの4拍目であるとき——仕事の性質が変わる。自律型AIエージェントは、ローンチして祈るものではなく、運用できるものになる:監視し、境界を設け、修正し、明示された限界の中で信頼できるものに。
それがデモと運用インテリジェンスの境界線だ。デモは信じることを求める。ランタイムは確認することを可能にする。自律型AIエージェントをスケールで運用するチームは、早い段階で、地味なプリミティブこそがプロダクトであると決断したチームだ——採点できないエージェントは、監視なしに行動する資格を持たない。