এমআইটি গবেষকরা “সিল” প্রকাশ করেছেন: স্ব-উন্নতি AI এর দিকে একটি নতুন পদক্ষেপ | সিঙ্ক্রোনাইজড

এমআইটি গবেষকরা “সিল” প্রকাশ করেছেন: স্ব-উন্নতি AI এর দিকে একটি নতুন পদক্ষেপ | সিঙ্ক্রোনাইজড

নেপাল বনাম নামিবিয়া


স্ব-উন্নতি AI-এর ধারণা সাম্প্রতিক গবেষণার বৃত্তে একটি আলোচিত বিষয় হয়ে উঠেছে, যেখানে বেশ কয়েকটি কাগজ প্রকাশিত হয়েছে এবং OpenAI CEO স্যাম অল্টম্যানের মতো বিশিষ্ট ব্যক্তিরা স্ব-বিকশিত বুদ্ধিমান সিস্টেমের ভবিষ্যত সম্পর্কে গুরুত্ব দিচ্ছেন। এখন, এমআইটি থেকে একটি নতুন গবেষণাপত্র, “স্ব-অভিযোজিত ভাষা মডেল” শিরোনাম উপস্থাপন করে সিল (স্ব-গতিসম্পন্ন এলএলএম অধ্যয়ন)একটি অভিনব কাঠামো যা বড় ভাষা মডেল (LLMs) কে তাদের ওজন আপডেট করতে দেয়। এই উন্নয়নকে সত্যিকারের স্ব-বিকশিত এআই-এর উপলব্ধির দিকে আরেকটি উল্লেখযোগ্য পদক্ষেপ হিসেবে দেখা হয়।

গতকাল প্রকাশিত গবেষণাপত্রটি হ্যাকার নিউজ সহ ইতিমধ্যে বেশ আলোচনার জন্ম দিয়েছে। SEAL একটি পদ্ধতি অফার করে যেখানে LLM “স্ব-সম্পাদনা” ব্যবহার করে তার নিজস্ব প্রশিক্ষণ ডেটা তৈরি করতে পারে এবং তারপরে নতুন ইনপুটগুলির উপর ভিত্তি করে এর ওজন আপডেট করতে পারে। অত্যন্ত গুরুত্বপূর্ণভাবে, এই স্ব-সম্পাদনা প্রক্রিয়াটি রিইনফোর্সমেন্ট লার্নিংয়ের মাধ্যমে শেখা হয়, আপডেট করা ডাউনস্ট্রিম মডেলের পারফরম্যান্সের সাথে রিওয়ার্ড মেকানিজম যুক্ত।

এমআইটি গবেষকরা “সিল” প্রকাশ করেছেন: স্ব-উন্নতি AI এর দিকে একটি নতুন পদক্ষেপ | সিঙ্ক্রোনাইজড

এআই স্ব-উন্নয়নের বিষয়ে সাম্প্রতিক আগ্রহের কারণে এই নিবন্ধের সময় বিশেষভাবে উল্লেখযোগ্য। এই মাসের শুরুর দিকে, সাকানা এআই এবং ইউনিভার্সিটি অফ ব্রিটিশ কলাম্বিয়ার ডারউইন-গোডেল মেশিন (ডিজিএম), সিএমইউ-এর স্ব-পুরস্কার প্রশিক্ষণ (এসআরটি), সাংহাই জিয়াও টং বিশ্ববিদ্যালয়ের MM-UPT ফ্রেমওয়ার্ক সহ বৃহৎ মাল্টিমডাল মডেলগুলিতে ক্রমাগত স্ব-উন্নতির জন্য আরও কয়েকটি গবেষণা প্রচেষ্টা নজর কেড়েছে, এবং এইচইউআই-ইউআই-ইউআই-তে আত্মসহযোগিতা

গুঞ্জন ছাড়াও, ওপেনএআই সিইও স্যাম অল্টম্যান সম্প্রতি তার ব্লগ পোস্ট “দ্য জেন্টেল সিঙ্গুলারিটি”-তে কৃত্রিম বুদ্ধিমত্তা এবং স্ব-উন্নতিকারী রোবটগুলির সাথে ভবিষ্যতের জন্য তার দৃষ্টিভঙ্গি শেয়ার করেছেন। তিনি যুক্তি দিয়েছিলেন যে লক্ষ লক্ষ হিউম্যানয়েড রোবটের ঐতিহ্যগত উত্পাদনের প্রয়োজন হবে, তারপরে তারা “আরো রোবট তৈরির জন্য পুরো সাপ্লাই চেইনকে সক্রিয় করতে পারে, যার ফলে আরও চিপ উত্পাদন সুবিধা, ডেটা সেন্টার এবং আরও অনেক কিছু তৈরি করা যেতে পারে।” এটি দ্রুত @VraserX-এর কাছ থেকে একটি টুইট করার প্ররোচনা দেয়, যিনি দাবি করেছিলেন যে একটি OpenAI অভ্যন্তরীণ ব্যক্তি প্রকাশ করেছে যে সংস্থাটি ইতিমধ্যেই পুনরাবৃত্তভাবে স্ব-উন্নত AI চালাচ্ছে, একটি দাবি যা এর সত্যতা সম্পর্কে ব্যাপক বিতর্কের জন্ম দিয়েছে।

OpenAI-এর অভ্যন্তরীণ উন্নয়নের সুনির্দিষ্টতা নির্বিশেষে, SEAL-এর MIT পেপার স্ব-বিবর্তনের দিকে AI-এর অগ্রগতির সুনির্দিষ্ট প্রমাণ প্রদান করে।

সিল বোঝা: স্ব-অভিযোজিত ভাষা মডেল

SEAL-এর পিছনে মূল ধারণা হল ভাষা মডেলগুলিকে নিজেদের উন্নত করার অনুমতি দেওয়া যখন তারা তাদের নিজস্ব সিন্থেটিক ডেটা তৈরি করে এবং স্ব-সম্পাদনার মাধ্যমে তাদের পরামিতিগুলিকে অপ্টিমাইজ করে নতুন ডেটার সম্মুখীন হয়। মডেলকে প্রশিক্ষণের উদ্দেশ্য হল মডেলের প্রসঙ্গে প্রদত্ত ডেটা ব্যবহার করে সরাসরি এই স্ব-অনুমান (SE) তৈরি করা।

এই স্ব-সম্পাদনাগুলির সৃষ্টি শক্তিবৃদ্ধি শিক্ষার মাধ্যমে শেখা হয়। মডেলটিকে পুরস্কৃত করা হয় যখন তৈরি করা স্ব-সম্পাদনা, বাস্তবায়নের পরে, লক্ষ্য টাস্কে উন্নত কর্মক্ষমতার দিকে নিয়ে যায়। অতএব, SEAL কে দুটি নেস্টেড লুপ সহ একটি অ্যালগরিদম হিসাবে ধারণা করা যেতে পারে: একটি আউটার লার্নিং (RL) লুপ যা eigenvalues ​​এর জেনারেশনকে অপ্টিমাইজ করে এবং একটি অভ্যন্তরীণ আপডেট লুপ যা গ্রেডিয়েন্ট ডিসেন্টের মাধ্যমে মডেল আপডেট করার জন্য জেনারেট করা আইজেন ভ্যালু ব্যবহার করে।

এই পদ্ধতিটিকে মেটা-লার্নিং-এর উদাহরণ হিসেবে দেখা যেতে পারে, যেখানে ফোকাস করা হয় কীভাবে মেটা-লার্নিং পদ্ধতিতে কার্যকর স্ব-সম্পাদনা তৈরি করা যায়।

সাধারণ কাঠামো

SEAL একটি একক টাস্ক ইনস্ট্যান্স (C,τ), যেখানে C হল টাস্ক-প্রাসঙ্গিক প্রসঙ্গ তথ্য, এবং τ মডেলের ফিট মূল্যায়নের জন্য ডাউনস্ট্রিম মূল্যায়নকারীকে সংজ্ঞায়িত করে। উদাহরণস্বরূপ, একটি জ্ঞান একীকরণ কার্যে, C মডেলের অভ্যন্তরীণ জ্ঞানের সাথে একীভূত করার জন্য একটি সেগমেন্ট হতে পারে এবং τ সেই বিভাগ সম্পর্কে প্রশ্নগুলির একটি সেট।

C দেওয়া হয়েছে, মডেলটি একটি স্ব-সম্পাদনা SE তৈরি করে, যা তত্ত্বাবধানে ফাইন-টিউনিংয়ের মাধ্যমে এর পরামিতি আপডেট করে: θ′←SFT(θ,SE)। এই স্ব-সম্পাদনা প্রজন্মকে অপ্টিমাইজ করতে রিইনফোর্সমেন্ট লার্নিং ব্যবহার করা হয়: মডেলটি একটি ক্রিয়া সম্পাদন করে (একটি SE তৈরি করে), τ-এ LMθ′-এর পারফরম্যান্সের উপর ভিত্তি করে একটি পুরষ্কার r পায়, এবং প্রত্যাশিত পুরস্কার সর্বাধিক করার জন্য তার নীতি আপডেট করে৷

গবেষকরা দেখেছেন যে জিআরপিও এবং পিপিওর মতো ঐতিহ্যগত অনলাইন নীতি পদ্ধতিগুলি অস্থির প্রশিক্ষণের দিকে পরিচালিত করে। শেষ পর্যন্ত তারা ডিপমাইন্ড কাগজ থেকে ফিল্টারিং এর উপর ভিত্তি করে একটি সহজ আচরণগত ক্লোনিং পদ্ধতি, ReST^EM বেছে নেয়। এই পদ্ধতিটিকে এক্সপেক্টেশন ম্যাক্সিমাইজেশন (EM) প্রক্রিয়া হিসাবে দেখা যেতে পারে, যেখানে বর্তমান মডেল নীতি থেকে ই-পদক্ষেপের নমুনা প্রার্থীর আউটপুট, এবং M-ধাপ শুধুমাত্র সেই নমুনাগুলিকে শক্তিশালী করে যেগুলি তত্ত্বাবধানে সূক্ষ্ম-টিউনিংয়ের মাধ্যমে একটি ইতিবাচক পুরস্কার দেয়।

কাগজটি আরও উল্লেখ করেছে যে বর্তমান বাস্তবায়ন স্ব-মূল্যায়ন তৈরি এবং শেখার জন্য একটি একক মডেল ব্যবহার করলে, এই ভূমিকাগুলি “শিক্ষক-ছাত্র” সেটআপে আলাদা করা যেতে পারে।

নির্দিষ্ট ডোমেনে একটি SEAL তৈরি করা

এমআইটি দল দুটি নির্দিষ্ট এলাকায় সিল তৈরি করেছে: জ্ঞান একীকরণ এবং কয়েক শট শেখা.

  • জ্ঞান একীকরণ: এখানে লক্ষ্য হল মডেলের ওজনে নিবন্ধ থেকে তথ্যকে দক্ষতার সাথে একত্রিত করা।
  • কিছু শট শেখা: এটি খুব কম উদাহরণ সহ মডেলটিকে নতুন কাজের সাথে মানিয়ে নেওয়া জড়িত।

পরীক্ষামূলক ফলাফল

স্পার্স লার্নিং এবং জ্ঞান একীকরণ উভয়ের জন্য পরীক্ষামূলক ফলাফল SEAL কাঠামোর কার্যকারিতা প্রদর্শন করে।

অন কয়েক শট শেখাLlama-3.2-1B-ইনস্ট্রাক্ট মডেল ব্যবহার করে, SEAL উল্লেখযোগ্যভাবে অভিযোজন সাফল্যের হারকে উন্নত করেছে, RL প্রশিক্ষণ ছাড়া মৌলিক স্ব-সম্পাদনা ব্যবহার করে মডেলগুলির জন্য 72.5% বনাম 20% অর্জন করেছে, এবং অভিযোজন ছাড়াই 0%। যদিও এখনও “ওরাকল টিটিটি” (আদর্শ বেসলাইন) এর নিচে, এটি উল্লেখযোগ্য অগ্রগতি নির্দেশ করে।

জন্য জ্ঞান একীকরণSQuAD নিবন্ধগুলি থেকে নতুন তথ্য অন্তর্ভুক্ত করার জন্য একটি বড় Qwen2.5-7B মডেল ব্যবহার করে, SEAL ধারাবাহিকভাবে বেসলাইন পদ্ধতিগুলিকে ছাড়িয়ে যেতে সক্ষম হয়েছিল৷ বেস Qwen-2.5-7B মডেল থেকে কৃত্রিমভাবে উত্পন্ন ডেটা সহ প্রশিক্ষণ ইতিমধ্যে উল্লেখযোগ্য উন্নতি দেখায়, এবং পরবর্তী শক্তিবৃদ্ধি শেখার কার্যকারিতা আরও বৃদ্ধি পায়। বাহ্যিক RL পুনরাবৃত্তির তুলনায় নির্ভুলতাও দ্রুত উন্নতি দেখায়, প্রায়শই GPT-4.1 জেনারেটেড ডেটা ব্যবহার করে মাত্র দুটি পুনরাবৃত্তিতে সেটিংসকে ছাড়িয়ে যায়।

নিবন্ধের গুণগত উদাহরণগুলি ব্যাখ্যা করে যে কীভাবে শক্তিবৃদ্ধি শিক্ষা আরও বিস্তারিত স্ব-সম্পাদনা তৈরির দিকে পরিচালিত করে, যার ফলে কর্মক্ষমতা উন্নত হয়।

যদিও প্রতিশ্রুতিশীল, গবেষকরা SEAL ফ্রেমওয়ার্কের কিছু সীমাবদ্ধতাও স্বীকার করেন, যার মধ্যে বিপর্যয়মূলক ভুলে যাওয়া, কম্পিউটেশনাল ওভারহেড এবং প্রসঙ্গ-নির্ভর মূল্যায়ন সম্পর্কিত দিকগুলি রয়েছে। মূল নিবন্ধে এগুলি বিস্তারিতভাবে আলোচনা করা হয়েছে।

মূল কাগজ: https://arxiv.org/pdf/2506.10943

প্রকল্পের ওয়েবসাইট: https://jyopari.github.io/posts/seal

গিথুব রেপো: https://github.com/Continuous-Intelligence/SEAL



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *