ডেমো সবসময় কাজ করে। একটি এজেন্ট টিকিট পড়ে, উত্তর খসড়া করে, রিফান্ড দাখিল করে, এবং লুপ বন্ধ করে — ঘরের সবাই মাথা নাড়ে। তারপর এটি শিপ হয়, দ্বিতীয় হাজার কেসের মুখোমুখি হয়, এবং এমন অর্ডারে রিফান্ড দিতে শুরু করে যা কখনো দেওয়াই হয়নি।
ডেমোতে কোনো মিথ্যা ছিল না। যা অনুপস্থিত ছিল তা হলো সেই সবকিছু যা দ্বিতীয় হাজার কেসকে সামলানোযোগ্য করে তোলে — যে অংশটা কেউ ফিল্ম করে না। স্বায়ত্তশাসিত AI এজেন্ট শুরু করা কঠিন নয়। কঠিন হলো তাদের সৎ রাখা।
ডেমো কোনো সিস্টেম নয়
একটি মডেল যা টুল কল করতে পারে সেটি একটি সক্ষমতা। একটি সিস্টেম যা সঠিক টুল, সঠিক সময়ে, সঠিক অবস্থার বিপরীতে কল করে এবং পরে ব্যাখ্যা করতে পারে কেন — সেটি অবকাঠামো। দুটির মধ্যে দূরত্ব একটি ভালো প্রম্পটে পূরণ হয় না।
ডেমোতে এজেন্ট একবার চলে, পর্যবেক্ষণের অধীনে, একটি সুখী পথে। প্রোডাকশনে এটি দশ হাজার বার চলে, অপর্যবেক্ষিত, এমন অবস্থার বিপরীতে যা পড়ার মুহূর্ত থেকে কাজ করার মুহূর্তের মধ্যে পরিবর্তিত হয়ে যায়। মেমরি পুরনো বা অনুপস্থিত। একটি পুনরায় চেষ্টা করা ধাপ দ্বিগুণ চার্জ করে। একটি টুল কল যা প্রত্যাখ্যান করা উচিত ছিল তা পার হয়ে যায় কারণ দরজায় কেউ দাঁড়িয়ে ছিল না।
এগুলো মডেলের ব্যর্থতা নয়। এগুলো সেই ব্যর্থতা যা একটি রানটাইমের শোষণ করার কথা। এগুলোকে প্রম্পটের সমস্যা হিসেবে দেখা হলো কীভাবে দলগুলো একটি কোয়ার্টার নির্দেশনা পুনরায় শব্দায়নে কাটায় এবং তবুও একটি ইনসিডেন্ট রিভিউতে একমাত্র গুরুত্বপূর্ণ প্রশ্নের উত্তর দিতে পারে না: এজেন্ট কী করেছিল, এবং কোন ভিত্তিতে।
স্বায়ত্তশাসিত AI এজেন্ট আসলে যে লুপ চালায়
Algenta একটি AI এজেন্ট রানটাইম যা একটি একক লুপকে কেন্দ্র করে গড়ে উঠেছে — প্রতিটি এজেন্ট এই লুপ চালায়, তার লেখকরা এটির নাম দিক বা না দিক। লুপটিকে স্পষ্ট করাই বেশিরভাগ কাজ।
- Sense — বিশ্বের বর্তমান অবস্থা পড়ো: ইনপুট, পুনরুদ্ধার করা মেমরি, সিদ্ধান্ত যে লাইভ মানগুলোর উপর নির্ভর করে।
- Plan — সেই অবস্থা এবং লক্ষ্য দিয়ে পরবর্তী কাজ বা পরবর্তী কয়েকটি কাজ নির্ধারণ করো।
- Execute — নিয়ন্ত্রিত টুলের মাধ্যমে কাজ করো, যেখানে প্রতিটি কল বাস্তবে কিছু স্পর্শ করার আগে পলিসির বিপরীতে যাচাই করা হয়।
- Evaluate — যা ঘটেছে তা প্রত্যাশার বিপরীতে বিচার করো, এবং সেই বিচার মেমরি ও পরবর্তী পরিকল্পনায় ফিরিয়ে দাও।
Sense, Plan, Execute, Evaluate। ধাপগুলো স্পষ্ট; শৃঙ্খলা হলো শেষটি এড়িয়ে যেতে অস্বীকার করা। বেশিরভাগ এজেন্ট ফ্রেমওয়ার্ক Execute-এ থেমে যায়, এবং এটাই কারণ তারা ডেমোতে ভালো করে এবং সময়ের সাথে খারাপ হয় — তারা কখনো মূল্যায়িত না হয়ে কাজ করে, তাই ত্রুটি নীরবে জমতে থাকে বরং যে মুহূর্তে ঘটে সেখানে ধরা পড়ার বদলে।
লুপের চারপাশে থাকে ভাগ করা প্রিমিটিভ যা পুরো রানটাইম প্রথম শ্রেণির হিসেবে বিবেচনা করে, সংযোজন হিসেবে নয়: memory যা এজেন্ট পড়ে ও লেখে, tools যার মাধ্যমে এটি কাজ করে, policy যা প্রতিটি কাজ নিয়ন্ত্রণ করে, traces যা যা ঘটেছে তা রেকর্ড করে, এবং evals যা নির্ধারণ করে এটি ভালো ছিল কিনা। লুপের প্রতিটি ধাপ প্রতিটি প্রিমিটিভ স্পর্শ করে। মেমরি Sense-কে পুষ্ট করে এবং Evaluate দ্বারা আপডেট হয়। Policy, Execute-কে নিয়ন্ত্রণ করে। Traces চারটিকেই ধারণ করে যাতে Evaluate-এর কাছে মূল্যায়নের জন্য সৎ কিছু থাকে।
যে এজেন্টকে মূল্যায়ন করা যায় না সে স্বায়ত্তশাসিত নয়। সে অপর্যবেক্ষিত।
কেন বিরক্তিকর প্রিমিটিভগুলোই পণ্য
মেমরি, পলিসি, ট্রেস, ইভাল। এর কোনোটাই ফটোজেনিক নয়। কিন্তু এই সবকিছুই একটি এজেন্টকে ঘরে কাজ করা থেকে বিশ্বে কাজ করায় পরিণত করে।
মেমরি হলো যা একটি এজেন্টকে এক সেকেন্ড আগে যা জানত তার ভিত্তিতে কাজ করতে দেয়, প্রতিটি কলে বিশ্ব পুনরায় আবিষ্কার না করে — এবং একটি রানটাইমকে স্থায়ী জ্ঞান এবং একটি একক রানের স্ক্র্যাচ স্পেসের মধ্যে রেখা টানতে হবে, কারণ এগুলো মিলিয়ে ফেলাই হলো কীভাবে একটি এজেন্ট নিজের হ্যালুসিনেশনকে বিশ্বাস করতে শুরু করে। Policy হলো একটি টুল যা এজেন্ট কল করতে পারে এবং একটি টুল যা এটি এখন কল করার অনুমতি পেয়েছে তার মধ্যে পার্থক্য — কার জন্য কাজ করছে এবং এই ঘণ্টায় ইতিমধ্যে কী করেছে তার ভিত্তিতে। Traces "এজেন্ট কিছু অদ্ভুত করেছে" কে একটি নির্দিষ্ট সিদ্ধান্তে পরিণত করে, একটি নির্দিষ্ট ইনপুটে, নির্দিষ্ট প্রসঙ্গ সহ — ডিবাগিং এবং অনুমানের মধ্যে পার্থক্য।
Evals হলো সেই প্রিমিটিভ যা দলগুলো সবার শেষে আবিষ্কার করে কিন্তু সবার আগে প্রয়োজন। এগুলো ছাড়া, "এজেন্ট কাজ করছে" মানে "এখনো কেউ জোরে অভিযোগ করেনি।" এগুলো থাকলে, প্রতিটি রান স্কোর করা হয় — যেখানে গ্রাউন্ড ট্রুথ আছে সেখানে তার বিপরীতে, যেখানে নেই সেখানে নিয়ম ও রুব্রিকের বিপরীতে — এবং একটি রিগ্রেশন একটি সংখ্যা হিসেবে দেখা দেয় যা সরে গেছে, যে পরিবর্তনে সরেছে, গ্রাহকের কাছে পৌঁছানোর আগেই।
অর্কেস্ট্রেশন একটি মাধ্যম, লক্ষ্য নয়
এজেন্ট অর্কেস্ট্রেশন বেশিরভাগ মনোযোগ পায় — ধাপের গ্রাফ, পুনরায় চেষ্টা, এজেন্ট ও সাব-এজেন্টের মধ্যে হ্যান্ড-অফ। এটি গুরুত্বপূর্ণ। কিন্তু গভর্ন্যান্স ছাড়া অর্কেস্ট্রেশন কেবল স্কেলে ভুল কাজ দ্রুত করার উপায়, এবং মূল্যায়ন ছাড়া অর্কেস্ট্রেশন তা না জেনে করার উপায়।
Algenta অর্কেস্ট্রেশনকে একটি AI এজেন্ট রানটাইম পরিবেশের একটি স্তর হিসেবে বিবেচনা করে, পুরোটা নয়। একটি পরিকল্পনা শাখা করতে পারে, অন্য এজেন্ট কল করতে পারে, কমিট করার আগে একটি কাজ পরীক্ষা করতে সিমুলেশন চালাতে পারে, এবং পলিসি দাবি করলে মানুষের জন্য অপেক্ষা করতে পারে — এবং এই প্রতিটি পদক্ষেপ একই ট্রেসে পড়ে, একই পলিসি দ্বারা নিয়ন্ত্রিত, একই ইভাল দ্বারা স্কোর করা। অর্কেস্ট্রেশন নির্ধারণ করে পরবর্তীতে কী হবে। রানটাইম নির্ধারণ করে এটি অনুমোদিত কিনা, এবং এটি সঠিক ছিল কিনা।
এটিই একটি AI এজেন্ট রানটাইম প্ল্যাটফর্মের নিরব দাবি: যে অনুভব করা, পরিকল্পনা করা, কাজ করা এবং বিচার করা প্রতিটি দলের জন্য হাতে পুনরায় একত্রিত করতে হবে না যারা প্রোডাকশনে একটি এজেন্ট চায়। এগুলো অবকাঠামো। আপনি এগুলো ধরে নিতে পারবেন যেভাবে ধরে নেন যে একটি ডেটাবেস টেকসই।
লুপ বন্ধ হলে কী পরিবর্তন হয়
যখন পূর্ণ লুপ চলে — যখন মূল্যায়ন পরের কথা নয় বরং প্রতিটি চক্রের চতুর্থ স্পন্দন — কাজের চরিত্র পরিবর্তিত হয়। স্বায়ত্তশাসিত AI এজেন্ট আর এমন কিছু থাকে না যা আপনি লঞ্চ করেন এবং আশা করেন, বরং এমন কিছু হয়ে ওঠে যা আপনি পরিচালনা করতে পারেন: দেখতে, সীমাবদ্ধ করতে, সংশোধন করতে এবং নির্দিষ্ট সীমার মধ্যে বিশ্বাস করতে পারেন।
এটিই ডেমো এবং অপারেশনাল ইন্টেলিজেন্সের মধ্যে রেখা। একটি ডেমো আপনাকে বিশ্বাস করতে বলে। একটি রানটাইম আপনাকে যাচাই করতে দেয়। যে দলগুলো স্কেলে স্বায়ত্তশাসিত AI এজেন্ট চালাবে তারা হলো যারা শুরুতেই সিদ্ধান্ত নেয় যে বিরক্তিকর প্রিমিটিভগুলোই পণ্য — এবং যে এজেন্টকে মূল্যায়ন করা যায় না সে অপর্যবেক্ষিতভাবে কাজ করার সুযোগ পায় না।