পিএসইউ এবং ডিউকের গবেষকরা “মাল্টি-এজেন্ট সিস্টেমের স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন | সিঙ্ক্রোনাইজড উপস্থাপন করেন

পিএসইউ এবং ডিউকের গবেষকরা “মাল্টি-এজেন্ট সিস্টেমের স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন | সিঙ্ক্রোনাইজড উপস্থাপন করেন

নেপাল বনাম নামিবিয়া


শেয়ার মাই রিসার্চ হল সিঙ্কড এর পৃষ্ঠা যা গবেষকদের তাদের নিজস্ব গবেষণার সাফল্য 2 মিলিয়নেরও বেশি বিশ্বব্যাপী AI উত্সাহীদের সাথে ভাগ করার জন্য স্বাগত জানায়। প্রযুক্তিগত অগ্রগতির বাইরে, শেয়ার মাই রিসার্চ-এর গবেষণার পিছনে আকর্ষণীয় গল্প এবং উত্তেজনাপূর্ণ গবেষণা ধারণারও প্রয়োজন।

লেখকের সাথে দেখা করুন
প্রতিষ্ঠান: পেন স্টেট ইউনিভার্সিটি, ডিউক ইউনিভার্সিটি, গুগল ডিপমাইন্ড, ইউনিভার্সিটি অফ ওয়াশিংটন, মেটা, নানিয়াং টেকনোলজিক্যাল ইউনিভার্সিটি এবং ওরেগন স্টেট ইউনিভার্সিটি। প্রথম লেখক হলেন পেন স্টেট ইউনিভার্সিটির শাওকুন ঝাং এবং ডিউক ইউনিভার্সিটির মিং ইয়িন।

সাম্প্রতিক বছরগুলিতে, এলএলএম মাল্টি-এজেন্ট সিস্টেমগুলি জটিল সমস্যা সমাধানের জন্য তাদের সহযোগিতামূলক পদ্ধতির জন্য ব্যাপক মনোযোগ অর্জন করেছে। যাইহোক, এটি একটি সাধারণ দৃশ্য যে এই সিস্টেমগুলি প্রচুর কার্যকলাপ সত্ত্বেও কাজটি ব্যর্থ করে। এটি বিকাশকারীদের একটি সমালোচনামূলক প্রশ্নের সাথে ছেড়ে দেয়: কোন এজেন্ট, কোন পর্যায়ে, ব্যর্থতার জন্য দায়ী ছিল? মূল কারণ খুঁজে বের করার জন্য বিশাল মিথস্ক্রিয়া লগগুলিকে sifting একটি খড়ের গাদায় একটি সুই খুঁজে পাওয়ার মতো মনে হয় – একটি সময়সাপেক্ষ এবং প্রচেষ্টা-নিবিড় প্রচেষ্টা৷
এটি বিকাশকারীদের জন্য একটি পরিচিত হতাশা। ক্রমবর্ধমান জটিল মাল্টি-এজেন্ট সিস্টেমে, ব্যর্থতাগুলি কেবল সাধারণ নয়, এজেন্ট সহযোগিতার স্বায়ত্তশাসিত প্রকৃতি এবং দীর্ঘ তথ্য শৃঙ্খলের কারণে নির্ণয় করা অবিশ্বাস্যভাবে কঠিন। ব্যর্থতার উৎস দ্রুত সনাক্ত করার উপায় ছাড়াই, সিস্টেম পুনরাবৃত্তি এবং অপ্টিমাইজেশান স্টল।
এই চ্যালেঞ্জ মোকাবেলা, থেকে গবেষকরা পেন স্টেট ইউনিভার্সিটি এবং ডিউক বিশ্ববিদ্যালয়সহ প্রতিষ্ঠানের সহযোগিতায় গুগল ডিপমাইন্ডএর উদ্ভাবনী গবেষণা সমস্যা প্রবর্তন করুন “স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন।” তারা এই কাজের জন্য প্রথম টেস্ট ডেটাসেট তৈরি করেছে, কে এবং কখনএবং বেশ কয়েকটি স্বয়ংক্রিয় অ্যাট্রিবিউশন পদ্ধতি বিকাশ ও মূল্যায়ন করেছে। এই কাজটি শুধুমাত্র কাজের জটিলতাকেই হাইলাইট করে না বরং এলএলএম মাল্টি-এজেন্ট সিস্টেমের নির্ভরযোগ্যতার উন্নতির দিকেও একটি নতুন পথ তৈরি করে।
নথি প্রায় গৃহীত হয় শীর্ষ স্তরের মেশিন লার্নিং সম্মেলনে স্পটলাইট উপস্থাপনা, ICML 2025এবং কোড এবং ডেটাসেট এখন সম্পূর্ণরূপে ওপেন সোর্স।

কাগজ: https://arxiv.org/pdf/2505.00212
কোড: https://github.com/mingyin1/Agents_Failure_Attribution
ডেটাসেট: https://huggingface.co/datasets/Kevin355/Who_and_When
গবেষণা পটভূমি এবং চ্যালেঞ্জ
এলএলএম দ্বারা চালিত মাল্টি-এজেন্ট সিস্টেমগুলি অনেক ক্ষেত্রে প্রচুর সম্ভাবনা দেখিয়েছে। যাইহোক, এই সিস্টেমগুলি ভঙ্গুর; একক এজেন্টের ত্রুটি, এজেন্টদের মধ্যে ভুল বোঝাবুঝি, বা তথ্য প্রেরণে ভুল পুরো মিশনের ব্যর্থতার কারণ হতে পারে।

বর্তমানে, যখন একটি সিস্টেম ব্যর্থ হয়, তখন ডেভেলপারদের প্রায়ই ডিবাগিংয়ের ম্যানুয়াল এবং অদক্ষ পদ্ধতিগুলি রেখে দেওয়া হয়:
জার্নালে ম্যানুয়াল প্রত্নতত্ত্ব : ডেভেলপারদের অবশ্যই সমস্যার উৎস খুঁজতে দীর্ঘ মিথস্ক্রিয়া লগগুলিকে ম্যানুয়ালি পর্যালোচনা করতে হবে৷
দক্ষতার উপর নির্ভরতা : ডিবাগিং প্রক্রিয়াটি বিকাশকারীর সিস্টেম এবং হাতে থাকা কাজ সম্পর্কে গভীর বোঝার উপর নির্ভর করে।
ডিবাগিংয়ের এই “খড়ের গাদায় সুই” পদ্ধতিটি কেবল অকার্যকরই নয় বরং দ্রুত সিস্টেমের পুনরাবৃত্তি এবং সিস্টেমের নির্ভরযোগ্যতার উন্নতিতে ব্যাপকভাবে বাধা দেয়। ব্যর্থতার কারণ খুঁজে বের করার জন্য এবং “অ্যাসেসমেন্ট ফলাফল” এবং “সিস্টেম উন্নতি” এর মধ্যে ব্যবধান কার্যকরভাবে পূরণ করার জন্য একটি স্বয়ংক্রিয় এবং পদ্ধতিগত পদ্ধতির জরুরী প্রয়োজন।

মূল অবদান
এই নিবন্ধটি উপরোক্ত চ্যালেঞ্জ মোকাবেলায় বেশ কিছু যুগান্তকারী অবদান রাখে:
1. একটি নতুন সমস্যা সংজ্ঞায়িত করুন: একটি নির্দিষ্ট গবেষণা কাজ হিসাবে “স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন” নিয়ে আসা কাগজটিই প্রথম। এই টাস্ক চিহ্নিত করে সংজ্ঞায়িত করা হয়

2. ব্যর্থতার জন্য দায়ী ফ্যাক্টর এবং আপনি গুরুত্বপূর্ণ ত্রুটি পদক্ষেপ যা মিশনের ব্যর্থতার দিকে পরিচালিত করে।

প্রথম বেঞ্চমার্ক ডেটাসেট তৈরি করা: কে এবং কখন : এই ডেটাসেটে 127টি এলএলএম মাল্টি-এজেন্ট সিস্টেম থেকে সংগৃহীত বিভিন্ন ধরনের ব্যর্থতা লগ অন্তর্ভুক্ত রয়েছে, যা বাস্তবতা এবং বৈচিত্র্য নিশ্চিত করার জন্য বিশেষজ্ঞদের দ্বারা হয় অ্যালগরিদমিকভাবে তৈরি বা হাতে তৈরি করা হয়েছে। প্রতিটি ব্যর্থতার লগের সাথে সূক্ষ্ম মানুষের মন্তব্য থাকে:
WHO: ব্যর্থতার জন্য দায়ী এজেন্ট।
যখন: নির্দিষ্ট মিথস্ক্রিয়া পদক্ষেপ যেখানে গুরুতর ত্রুটি ঘটেছে।
কেন: ব্যর্থতার কারণ সম্পর্কে স্বাভাবিক ভাষায় ব্যাখ্যা।

3. প্রাথমিক “স্বয়ংক্রিয় অ্যাট্রিবিউশন” পদ্ধতিগুলি পরীক্ষা করা: কে এবং কখন ডেটা সেট ব্যবহার করে, কাগজটি স্বয়ংক্রিয় ব্যর্থতার বৈশিষ্ট্যের জন্য তিনটি ভিন্ন পদ্ধতি ডিজাইন এবং মূল্যায়ন করে:
একযোগে: এই পদ্ধতিটি ব্যবহারকারীর ক্যোয়ারী এবং সম্পূর্ণ ব্যর্থতার লগ সহ LLM প্রদান করে এবং এটিকে দায়ী এজেন্ট সনাক্ত করতে বলে এবং একটি পাসে গুরুতর ত্রুটির ধাপটি সনাক্ত করতে বলে। যদিও এটি লাভজনক, এটি দীর্ঘ প্রসঙ্গে সঠিক ত্রুটিগুলি খুঁজে পেতে সংগ্রাম করতে পারে।
ধাপে ধাপে: এই পদ্ধতিটি ম্যানুয়াল ডিবাগিংকে অনুকরণ করে LLM দ্বারা পর্যায়ক্রমে ইন্টারঅ্যাকশন লগ পরীক্ষা করে, যতক্ষণ না ত্রুটি পাওয়া যায় প্রতিটি ধাপে বিচার করে। এটি ত্রুটি পর্যায় সনাক্তকরণের ক্ষেত্রে আরও সঠিক তবে উচ্চতর খরচ এবং ত্রুটিগুলি জমা করার ঝুঁকি জড়িত।
বাইনারি অনুসন্ধান: প্রথম দুটি পদ্ধতির মধ্যে একটি সমঝোতা, এই কৌশলটি বারবার লগকে অর্ধেক ভাগ করে দেয়, কোন সেগমেন্টে ত্রুটি রয়েছে তা নির্ধারণ করতে LLM ব্যবহার করে। তারপরে এটি পুনরাবৃত্তভাবে চিহ্নিত সেগমেন্ট অনুসন্ধান করে, খরচ এবং কর্মক্ষমতার মধ্যে ভারসাম্য অফার করে।

পরীক্ষামূলক ফলাফল এবং মূল ফলাফল

পরীক্ষাগুলি দুটি সেটিংসে পরিচালিত হয়েছিল: একটি যেখানে এলএলএম সমস্যার আসল উত্তর জানে যে মাল্টি-এজেন্ট সিস্টেমটি সমাধান করার চেষ্টা করছে (স্থল সত্যের সাথে) এবং একটি যেখানে নেই (স্থল সত্য ছাড়া) ব্যবহৃত প্রধান মডেলটি ছিল GPT-4o, যদিও অন্যান্য মডেলগুলিও পরীক্ষা করা হয়েছিল। কে এবং কখন বেশ কিছু গুরুত্বপূর্ণ অন্তর্দৃষ্টি পেল তার ডেটা সেটে এই পদ্ধতিগুলির পদ্ধতিগত মূল্যায়ন:

  • একটি দীর্ঘ পথ যেতে: বর্তমান পদ্ধতি নিখুঁত থেকে অনেক দূরে. এমনকি একক সেরা পারফরম্যান্স পদ্ধতিও প্রায় নির্ভুলতা অর্জন করেছে 53.5% দায়িত্বশীল পক্ষ সনাক্তকরণ এবং সহজভাবে 14.2% সঠিক ত্রুটি পদক্ষেপ সনাক্তকরণে. কিছু পদ্ধতি এলোমেলো অনুমান করার চেয়েও ভাল কাজ করেছে, টাস্কের অসুবিধার উপর জোর দিয়েছে।
  • কোন “সব এক” সমাধান নেই।: বিভিন্ন পদ্ধতি সমস্যার বিভিন্ন দিক থেকে এক্সেল. দ সব একযোগে পদ্ধতিটি “কে” শনাক্ত করার ক্ষেত্রে ভাল ধাপে ধাপে পদ্ধতিটি “কখন” নির্ধারণে আরও কার্যকর। দ বাইনারি অনুসন্ধান পদ্ধতি মধ্যম কর্মক্ষমতা প্রদান করে.
পিএসইউ এবং ডিউকের গবেষকরা “মাল্টি-এজেন্ট সিস্টেমের স্বয়ংক্রিয় ব্যর্থতা অ্যাট্রিবিউশন | সিঙ্ক্রোনাইজড উপস্থাপন করেন
  • হাইব্রিড পদ্ধতি প্রতিশ্রুতিশীল কিন্তু উচ্চ খরচ: গবেষকরা দেখেছেন যে বিভিন্ন পদ্ধতি একত্রিত করা, যেমন একটি সম্ভাব্য এজেন্ট সনাক্ত করার জন্য একটি সব-এ-একবার পদ্ধতি ব্যবহার করা এবং তারপরে ত্রুটি খুঁজে বের করার জন্য ধাপে ধাপে পদ্ধতি প্রয়োগ করা, সামগ্রিক কর্মক্ষমতা উন্নত করতে পারে। যাইহোক, এটি গণনামূলক খরচে উল্লেখযোগ্য বৃদ্ধির সাথে আসে।
  • প্রসঙ্গের দৈর্ঘ্য একটি সীমাবদ্ধ ফ্যাক্টর: সমীক্ষায় আরও দেখা গেছে যে ব্যর্থতার লগগুলির প্রসঙ্গ দৈর্ঘ্য বৃদ্ধির সাথে সাথে সমস্ত রেফারেন্স পদ্ধতির কার্যকারিতা হ্রাস পেতে থাকে, ত্রুটি ফেজ সনাক্তকরণের নির্ভুলতার উপর আরও স্পষ্ট প্রভাব সহ।



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *