আমার গবেষণা শেয়ার করুন 1.5 মিলিয়নেরও বেশি বিশ্বব্যাপী AI উত্সাহীদের সাথে তাদের নিজস্ব গবেষণার অগ্রগতি শেয়ার করার জন্য গবেষকদেরকে স্বাগত জানায় সিঙ্কডের কলাম। প্রযুক্তিগত উন্নতির বাইরে, আমার গবেষণা শেয়ার করুন এছাড়াও গবেষণা এবং উত্তেজনাপূর্ণ গবেষণা ধারনা পিছনে আকর্ষণীয় গল্প আহ্বান. আমাদের সাথে যোগাযোগ করুন: chain.zhang@jiqizhixin.com
লেখকদের সাথে দেখা করুন
প্রতিষ্ঠান: পেন স্টেট ইউনিভার্সিটি, ডিউক ইউনিভার্সিটি, গুগল ডিপমাইন্ড, ইউনিভার্সিটি অফ ওয়াশিংটন, মেটা, নানিয়াং টেকনোলজিক্যাল ইউনিভার্সিটি এবং ওরেগন স্টেট ইউনিভার্সিটি। প্রথম লেখকরা হলেন শাওকুন ঝাং পেন স্টেট ইউনিভার্সিটি থেকে এবং মিং ইয়িন ডিউক বিশ্ববিদ্যালয় থেকে।
সাম্প্রতিক বছরগুলিতে, এলএলএম মাল্টি-এজেন্ট সিস্টেমগুলি জটিল সমস্যা সমাধানের জন্য তাদের সহযোগিতামূলক পদ্ধতির জন্য ব্যাপক মনোযোগ অর্জন করেছে। যাইহোক, এটি একটি সাধারণ দৃশ্য যে এই সিস্টেমগুলি প্রচুর কার্যকলাপ সত্ত্বেও কাজটি ব্যর্থ করে। এটি বিকাশকারীদের একটি সমালোচনামূলক প্রশ্নের সাথে ছেড়ে দেয়: কোন এজেন্ট, কোন পর্যায়ে, ব্যর্থতার জন্য দায়ী ছিল? মূল কারণ খুঁজে বের করার জন্য বিশাল মিথস্ক্রিয়া লগগুলিকে sifting একটি খড়ের গাদায় একটি সুই খুঁজে পাওয়ার মতো মনে হয় – একটি সময়সাপেক্ষ এবং প্রচেষ্টা-নিবিড় প্রচেষ্টা৷
এটি বিকাশকারীদের জন্য একটি পরিচিত হতাশা। ক্রমবর্ধমান জটিল মাল্টি-এজেন্ট সিস্টেমে, ব্যর্থতাগুলি কেবল সাধারণ নয়, এজেন্ট সহযোগিতার স্বায়ত্তশাসিত প্রকৃতি এবং দীর্ঘ তথ্য শৃঙ্খলের কারণে নির্ণয় করা অবিশ্বাস্যভাবে কঠিন। ব্যর্থতার উৎস দ্রুত সনাক্ত করার উপায় ছাড়াই, সিস্টেম পুনরাবৃত্তি এবং অপ্টিমাইজেশান স্টল।
এই চ্যালেঞ্জ মোকাবেলা, থেকে গবেষকরা পেন স্টেট ইউনিভার্সিটি এবং ডিউক বিশ্ববিদ্যালয়সহ প্রতিষ্ঠানের সহযোগিতায় গুগল ডিপমাইন্ডএর উদ্ভাবনী গবেষণা সমস্যা প্রবর্তন করুন “স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন।” তারা এই কাজের জন্য প্রথম টেস্ট ডেটাসেট তৈরি করেছে, কে এবং কখনএবং বেশ কয়েকটি স্বয়ংক্রিয় অ্যাট্রিবিউশন পদ্ধতি বিকাশ ও মূল্যায়ন করেছে। এই কাজটি শুধুমাত্র কাজের জটিলতাকেই হাইলাইট করে না বরং এলএলএম মাল্টি-এজেন্ট সিস্টেমের নির্ভরযোগ্যতার উন্নতির দিকেও একটি নতুন পথ তৈরি করে।
নথি প্রায় গৃহীত হয় শীর্ষ স্তরের মেশিন লার্নিং সম্মেলনে স্পটলাইট উপস্থাপনা, ICML 2025এবং কোড এবং ডেটাসেট এখন সম্পূর্ণরূপে ওপেন সোর্স।
কাগজ: https://arxiv.org/pdf/2505.00212
কোড: https://github.com/mingyin1/Agents_Failure_Attribution
ডেটাসেট: https://huggingface.co/datasets/Kevin355/Who_and_When
গবেষণা পটভূমি এবং চ্যালেঞ্জ
এলএলএম দ্বারা চালিত মাল্টি-এজেন্ট সিস্টেমগুলি অনেক ক্ষেত্রে প্রচুর সম্ভাবনা দেখিয়েছে। যাইহোক, এই সিস্টেমগুলি ভঙ্গুর; একক এজেন্টের ত্রুটি, এজেন্টদের মধ্যে ভুল বোঝাবুঝি, বা তথ্য প্রেরণে ভুল পুরো মিশনের ব্যর্থতার কারণ হতে পারে।
বর্তমানে, যখন একটি সিস্টেম ব্যর্থ হয়, তখন ডেভেলপারদের প্রায়ই ডিবাগিংয়ের ম্যানুয়াল এবং অদক্ষ পদ্ধতিগুলি রেখে দেওয়া হয়:
জার্নালে ম্যানুয়াল প্রত্নতত্ত্ব : ডেভেলপারদের অবশ্যই সমস্যার উৎস খুঁজতে দীর্ঘ মিথস্ক্রিয়া লগগুলিকে ম্যানুয়ালি পর্যালোচনা করতে হবে৷
দক্ষতার উপর নির্ভরতা : ডিবাগিং প্রক্রিয়াটি বিকাশকারীর সিস্টেম এবং হাতে থাকা কাজ সম্পর্কে গভীর বোঝার উপর নির্ভর করে।
ডিবাগিংয়ের এই “খড়ের গাদায় সুই” পদ্ধতিটি কেবল অকার্যকরই নয় বরং দ্রুত সিস্টেমের পুনরাবৃত্তি এবং সিস্টেমের নির্ভরযোগ্যতার উন্নতিতে ব্যাপকভাবে বাধা দেয়। ব্যর্থতার কারণ খুঁজে বের করার জন্য এবং “অ্যাসেসমেন্ট ফলাফল” এবং “সিস্টেম উন্নতি” এর মধ্যে ব্যবধান কার্যকরভাবে পূরণ করার জন্য একটি স্বয়ংক্রিয় এবং পদ্ধতিগত পদ্ধতির জরুরী প্রয়োজন।
মূল অবদান
এই নিবন্ধটি উপরোক্ত চ্যালেঞ্জ মোকাবেলায় বেশ কিছু যুগান্তকারী অবদান রাখে:
1. একটি নতুন সমস্যা সংজ্ঞায়িত করুন: একটি নির্দিষ্ট গবেষণা কাজ হিসাবে “স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন” নিয়ে আসা কাগজটিই প্রথম। এই টাস্ক চিহ্নিত করে সংজ্ঞায়িত করা হয় ব্যর্থতার জন্য দায়ী ফ্যাক্টর এবং আপনি গুরুত্বপূর্ণ ত্রুটি পদক্ষেপ যা মিশনের ব্যর্থতার দিকে পরিচালিত করে।
2. প্রথম বেঞ্চমার্ক ডেটাসেট তৈরি করা: কে এবং কখন : এই ডেটাসেটে 127টি এলএলএম মাল্টি-এজেন্ট সিস্টেম থেকে সংগৃহীত বিভিন্ন ধরনের ব্যর্থতা লগ অন্তর্ভুক্ত রয়েছে, যা বাস্তবতা এবং বৈচিত্র্য নিশ্চিত করার জন্য বিশেষজ্ঞদের দ্বারা হয় অ্যালগরিদমিকভাবে তৈরি বা হাতে তৈরি করা হয়েছে। প্রতিটি ব্যর্থতার লগের সাথে সূক্ষ্ম মানুষের মন্তব্য থাকে:
WHO: ব্যর্থতার জন্য দায়ী এজেন্ট।
যখন: নির্দিষ্ট মিথস্ক্রিয়া পদক্ষেপ যেখানে গুরুতর ত্রুটি ঘটেছে।
কেন: ব্যর্থতার কারণ সম্পর্কে স্বাভাবিক ভাষায় ব্যাখ্যা।
3. প্রাথমিক “স্বয়ংক্রিয় অ্যাট্রিবিউশন” পদ্ধতিগুলি পরীক্ষা করা: কে এবং কখন ডেটা সেট ব্যবহার করে, নিবন্ধটি স্বয়ংক্রিয় ব্যর্থতার বৈশিষ্ট্যের জন্য তিনটি ভিন্ন পদ্ধতি ডিজাইন এবং মূল্যায়ন করে:
– একযোগে: এই পদ্ধতিটি ব্যবহারকারীর ক্যোয়ারী এবং সম্পূর্ণ ব্যর্থতার লগ সহ LLM প্রদান করে এবং এটিকে দায়ী এজেন্ট সনাক্ত করতে বলে এবং একটি পাসে গুরুতর ত্রুটির পদক্ষেপটি সনাক্ত করতে বলে। যদিও এটি লাভজনক, এটি দীর্ঘ প্রসঙ্গে সঠিক ত্রুটিগুলি খুঁজে পেতে সংগ্রাম করতে পারে।
– ধাপে ধাপে: এই পদ্ধতিটি ম্যানুয়াল ডিবাগিংকে অনুকরণ করে LLM পর্যায়ক্রমে ইন্টারঅ্যাকশন লগ পর্যালোচনা করে, যতক্ষণ না ত্রুটি পাওয়া যায় প্রতিটি ধাপে বিচার করে। এটি ত্রুটি পর্যায় সনাক্তকরণের ক্ষেত্রে আরও সঠিক তবে উচ্চতর খরচ এবং ত্রুটিগুলি জমা করার ঝুঁকি জড়িত।
– বাইনারি অনুসন্ধান: প্রথম দুটি পদ্ধতির মধ্যে একটি সমঝোতা, এই কৌশলটি বারবার লগকে অর্ধেক ভাগ করে দেয়, কোন সেগমেন্টে ত্রুটি রয়েছে তা নির্ধারণ করতে LLM ব্যবহার করে। তারপরে এটি পুনরাবৃত্তভাবে চিহ্নিত সেগমেন্ট অনুসন্ধান করে, খরচ এবং কর্মক্ষমতার মধ্যে ভারসাম্য অফার করে।
পরীক্ষামূলক ফলাফল এবং মূল ফলাফল
পরীক্ষাগুলি দুটি সেটিংসে পরিচালিত হয়েছিল: একটি যেখানে এলএলএম সমস্যার আসল উত্তর জানে যে মাল্টি-এজেন্ট সিস্টেমটি সমাধান করার চেষ্টা করছে (স্থল সত্যের সাথে) এবং একটি যেখানে নেই (স্থল সত্য ছাড়া) ব্যবহৃত প্রধান মডেলটি ছিল GPT-4o, যদিও অন্যান্য মডেলগুলিও পরীক্ষা করা হয়েছিল। কে এবং কখন বেশ কিছু গুরুত্বপূর্ণ অন্তর্দৃষ্টি পেল তার ডেটা সেটে এই পদ্ধতিগুলির পদ্ধতিগত মূল্যায়ন:
– একটি দীর্ঘ পথ যেতে: বর্তমান পদ্ধতি নিখুঁত থেকে অনেক দূরে. এমনকি একক সেরা পারফরম্যান্স পদ্ধতিও প্রায় নির্ভুলতা অর্জন করেছে 53.5% দায়িত্বশীল পক্ষ সনাক্তকরণ এবং সহজভাবে 14.2% সঠিক ত্রুটি পদক্ষেপ সনাক্তকরণে. কিছু পদ্ধতি এলোমেলো অনুমান করার চেয়েও ভাল কাজ করেছে, টাস্কের অসুবিধার উপর জোর দিয়েছে।
– কোন “সব এক” সমাধান নেই।: বিভিন্ন পদ্ধতি সমস্যার বিভিন্ন দিক থেকে এক্সেল. দ সব একযোগে পদ্ধতিটি “কে” শনাক্ত করার ক্ষেত্রে ভাল ধাপে ধাপে পদ্ধতিটি “কখন” নির্ধারণে আরও কার্যকর। দ বাইনারি অনুসন্ধান পদ্ধতি মধ্যম কর্মক্ষমতা প্রদান করে.
– হাইব্রিড পদ্ধতি প্রতিশ্রুতিশীল কিন্তু উচ্চ খরচ: গবেষকরা দেখেছেন যে বিভিন্ন পদ্ধতি একত্রিত করা, যেমন একটি সম্ভাব্য এজেন্ট সনাক্ত করার জন্য একটি সব-এ-একবার পদ্ধতি ব্যবহার করা এবং তারপরে ত্রুটি খুঁজে বের করার জন্য ধাপে ধাপে পদ্ধতি প্রয়োগ করা, সামগ্রিক কর্মক্ষমতা উন্নত করতে পারে। যাইহোক, এটি গণনামূলক খরচে উল্লেখযোগ্য বৃদ্ধির সাথে আসে।
– বর্তমান মডেলের সংগ্রাম: আশ্চর্যজনকভাবে, এমনকি সবচেয়ে উন্নত লজিক মডেল, যেমন OpenAI o1 এবং DeepSeek R1, এই কাজটিকে চ্যালেঞ্জিং বলে মনে করে। এটি স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশনের অন্তর্নিহিত অসুবিধাকে হাইলাইট করে, যা আরও প্রচলিত কাজের জন্য প্রয়োজনীয়তার চেয়ে উচ্চ স্তরের চিন্তার প্রয়োজন।
– সুস্পষ্ট যুক্তির গুরুত্ব: একযোগে এবং ধাপে ধাপে পদ্ধতি ব্যবহার করে LLM-কে তাদের যুক্তি ব্যাখ্যা করার জন্য সুস্পষ্ট নির্দেশাবলী প্রদান করা কর্মক্ষমতা উন্নত করতে দেখানো হয়েছে।

– প্রসঙ্গের দৈর্ঘ্য একটি সীমাবদ্ধ ফ্যাক্টর: সমীক্ষায় আরও দেখা গেছে যে ব্যর্থতার লগগুলির প্রসঙ্গ দৈর্ঘ্য বৃদ্ধির সাথে সাথে সমস্ত রেফারেন্স পদ্ধতির কার্যকারিতা হ্রাস পেতে থাকে, ত্রুটি ফেজ সনাক্তকরণের নির্ভুলতার উপর আরও স্পষ্ট প্রভাব সহ।
– ভবিষ্যত আউটলুক: আরো নির্ভরযোগ্য মাল্টি-এজেন্ট সিস্টেমের জন্য পথ প্রশস্ত করা
“স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন” মাল্টি-এজেন্ট সিস্টেমের বিকাশের জীবন চক্রের একটি গুরুত্বপূর্ণ উপাদান। এটি একটি বিভ্রান্তিকর রহস্য থেকে “কী ভুল হয়েছে এবং কে দায়ী” সনাক্তকরণের চ্যালেঞ্জকে একটি পরিমাপযোগ্য এবং বিশ্লেষণযোগ্য সমস্যায় রূপান্তরিত করার সম্ভাবনা রয়েছে। মূল্যায়ন এবং উন্নতির মধ্যে একটি সেতু নির্মাণ করে, আমরা শেষ পর্যন্ত বহু-এজেন্ট সিস্টেম তৈরি করতে পারি যা আরও নির্ভরযোগ্য, বুদ্ধিমান এবং নির্ভরযোগ্য।