
এমআইটি গবেষকরা দীর্ঘমেয়াদী ভিজ্যুয়াল কাজের পরিকল্পনা করার জন্য একটি জেনারেটিভ কৃত্রিম বুদ্ধিমত্তা-চালিত পদ্ধতি তৈরি করেছেন, যেমন রোবট নেভিগেশন, যা কিছু বিদ্যমান কৌশলগুলির তুলনায় প্রায় দ্বিগুণ কার্যকর।
তাদের পদ্ধতিটি চিত্রে দৃশ্যপট ক্যাপচার করতে এবং লক্ষ্যে পৌঁছানোর জন্য প্রয়োজনীয় ক্রিয়াগুলি অনুকরণ করতে একটি বিশেষ দৃষ্টি ভাষা মডেল ব্যবহার করে। তারপরে একটি দ্বিতীয় মডেল ডিজাইন সমস্যার জন্য এই সিমুলেশনগুলিকে একটি আদর্শ প্রোগ্রামিং ভাষায় অনুবাদ করে এবং সমাধানটি পরিমার্জন করে।
শেষ পর্যন্ত, সিস্টেম স্বয়ংক্রিয়ভাবে ফাইলগুলির একটি সেট তৈরি করে যা একটি ক্লাসিক পরিকল্পনা সফ্টওয়্যারে প্রবেশ করা যেতে পারে, যা লক্ষ্য অর্জনের জন্য একটি পরিকল্পনা গণনা করে। এই দ্বি-পদক্ষেপ সিস্টেমটি প্রায় 70 শতাংশের গড় সাফল্যের হার সহ প্রোগ্রাম তৈরি করেছে, সেরা বেসলাইন পদ্ধতিগুলিকে ছাড়িয়ে গেছে যা কেবলমাত্র 30 শতাংশ অর্জন করতে পারে।
গুরুত্বপূর্ণভাবে, সিস্টেমটি এমন নতুন সমস্যার সমাধান করতে পারে যা এটি আগে সম্মুখীন হয়নি, এটিকে বাস্তব পরিবেশের জন্য উপযুক্ত করে তোলে যেখানে পরিস্থিতি মুহূর্তের মধ্যে পরিবর্তন হতে পারে।
“আমাদের ফ্রেমওয়ার্ক ভিশন ল্যাঙ্গুয়েজ মডেলের সুবিধাগুলিকে একত্রিত করে, যেমন ছবি বোঝার ক্ষমতা, একটি আনুষ্ঠানিক সমাধানকারীর শক্তিশালী ডিজাইনের ক্ষমতার সাথে,” বলেছেন Yilun Hao, MIT-এর অ্যারোনটিক্স অ্যান্ড অ্যাস্ট্রোনটিক্স (AeroAstro) এর একজন স্নাতক ছাত্র এবং এই কৌশলটির উপর একটি ওপেন অ্যাক্সেস পেপারের প্রধান লেখক৷ “এটি একটি একক চিত্র নিতে পারে এবং এটিকে একটি সিমুলেশনের মাধ্যমে এবং তারপরে একটি দীর্ঘমেয়াদী নির্ভরযোগ্য প্রোগ্রামে রাখতে পারে যা অনেক বাস্তব-জীবনের অ্যাপ্লিকেশনগুলিতে কার্যকর হতে পারে।”
এমআইটির ল্যাবরেটরি ফর ইনফরমেশন অ্যান্ড ডিসিশন সিস্টেমস (এলআইডিএস) এর স্নাতক ছাত্র ইয়ংচাও চেন এই গবেষণাপত্রে যোগ দিয়েছেন; চুচু ফ্যান, অ্যারোঅ্যাস্ট্রোর সহযোগী অধ্যাপক এবং LIDS-এর প্রধান তদন্তকারী; এবং ইয়াং ঝাং, এমআইটি-আইবিএম ওয়াটসন এআই ল্যাবের গবেষণা বিজ্ঞানী। আর্টিকেলটি ইন্টারন্যাশনাল কনফারেন্স অন লার্নিং রিপ্রেজেন্টেশনে উপস্থাপন করা হবে।
চাক্ষুষ কাজ সঙ্গে মোকাবিলা
সাম্প্রতিক বছরগুলিতে, ফ্যান এবং তার সহকর্মীরা জটিল যুক্তি এবং পরিকল্পনা সঞ্চালনের জন্য কৃত্রিম বুদ্ধিমত্তা মডেলের ব্যবহার অধ্যয়ন করেছেন এবং পাঠ্য ইনপুট প্রক্রিয়া করার জন্য প্রায়শই বড় ভাষা মডেল (LLMs) ব্যবহার করেন।
অনেক বাস্তব-বিশ্বের নকশা সমস্যা, যেমন রোবোটিক সমাবেশ এবং স্বায়ত্তশাসিত ড্রাইভিং, এর ভিজ্যুয়াল ইনপুট রয়েছে যা এলএলএম নিজে থেকে ভালভাবে পরিচালনা করতে পারে না। গবেষকরা ভিজ্যুয়াল ল্যাঙ্গুয়েজ মডেল (ভিএলএম), শক্তিশালী কৃত্রিম বুদ্ধিমত্তা সিস্টেম ব্যবহার করে ভিজ্যুয়াল ডোমেনে প্রসারিত করতে চেয়েছিলেন যা ছবি এবং পাঠ্য প্রক্রিয়া করতে পারে।
কিন্তু ভিএলএম একটি দৃশ্যে বস্তুর মধ্যে স্থানিক সম্পর্ক বোঝার জন্য সংগ্রাম করে এবং প্রায়শই একাধিক ধাপে সঠিকভাবে প্রতিক্রিয়া জানাতে ব্যর্থ হয়। এটি দীর্ঘমেয়াদী পরিকল্পনার জন্য ভিএলএম ব্যবহার করা কঠিন করে তোলে।
অন্যদিকে, বিজ্ঞানীরা শক্তিশালী, আনুষ্ঠানিক পরিকল্পনাকারী তৈরি করেছেন যারা জটিল পরিস্থিতিতে কার্যকর দীর্ঘমেয়াদী পরিকল্পনা তৈরি করতে পারে। যাইহোক, এই সফ্টওয়্যার সিস্টেমগুলি ভিজ্যুয়াল ইনপুটগুলি প্রক্রিয়া করতে পারে না এবং সমাধানকারী বুঝতে পারে এমন একটি ভাষাতে সমস্যা এনকোড করার জন্য বিশেষজ্ঞ জ্ঞানের প্রয়োজন হয়।
ফ্যান এবং তার দল একটি স্বয়ংক্রিয় পরিকল্পনা ব্যবস্থা তৈরি করেছে যা উভয় পদ্ধতির সেরাটি নেয়৷ VLM-গাইডেড ফরমাল প্ল্যানিং (VLMFP) নামক সিস্টেমটি দুটি বিশেষায়িত VLM ব্যবহার করে যা ভিজ্যুয়াল প্ল্যানিং সমস্যাগুলিকে ফর্মাল প্ল্যানিং সফ্টওয়্যারের জন্য রেডি-টু-ব্যবহারের ফাইলে পরিণত করতে একসাথে কাজ করে।
গবেষকরা প্রথমে সাবধানে একটি ছোট মডেলকে প্রশিক্ষণ দিয়েছিলেন যাকে তারা সিমভিএলএম বলে যেটিকে প্রাকৃতিক ভাষা ব্যবহার করে চিত্রের দৃশ্যকল্প বর্ণনা করতে এবং সেই দৃশ্যে ক্রিয়াগুলির একটি ক্রম অনুকরণে বিশেষজ্ঞ করতে। তারপর একটি অনেক বড় মডেল, যাকে তারা GenVLM বলে, SimVLM থেকে বর্ণনা ব্যবহার করে প্ল্যানিং ডোমেন ডেফিনিশন ল্যাঙ্গুয়েজ (PDDL) নামে পরিচিত একটি আনুষ্ঠানিক পরিকল্পনা ভাষায় প্রাথমিক ফাইলগুলির একটি সেট তৈরি করতে।
ফাইলগুলি একটি ক্লাসিক PDDL সল্ভারে খাওয়ানোর জন্য প্রস্তুত, যা টাস্ক সমাধানের জন্য একটি ধাপে ধাপে প্রোগ্রাম গণনা করে। GenVLM সমাধানকারীর ফলাফলগুলিকে সিমুলেটরের সাথে তুলনা করে এবং পুনরাবৃত্তিমূলকভাবে PDDL ফাইলগুলিকে উন্নত করে।
“জেনারেটর এবং সিমুলেটর একসাথে কাজ করে সঠিক একই ফলাফল অর্জন করতে সক্ষম হয়, যা একটি অ্যাকশন সিমুলেশন যা লক্ষ্য অর্জন করে,” হাউ বলেছেন।
যেহেতু GenVLM একটি বৃহৎ সৃজনশীল AI মডেল, এটি প্রশিক্ষণের সময় PDDL-এর অনেক উদাহরণ দেখেছে এবং শিখেছে কীভাবে এই আনুষ্ঠানিক ভাষা বিভিন্ন ধরনের সমস্যার সমাধান করতে পারে। এই বিদ্যমান জ্ঞান মডেলটিকে সঠিক PDDL ফাইল তৈরি করতে দেয়।
নমনীয় পদ্ধতির
VLMFP দুটি পৃথক PDDL ফাইল তৈরি করে। প্রথমটি হল একটি ডোমেন ফাইল যা পরিবেশ, আইনী ক্রিয়াকলাপ এবং ডোমেনের নিয়মগুলিকে সংজ্ঞায়িত করে। এটি একটি সমস্যা ফাইল তৈরি করে যা হাতে একটি নির্দিষ্ট সমস্যার প্রাথমিক অবস্থা এবং লক্ষ্য নির্ধারণ করে।
“PDDL-এর একটি সুবিধা হল যে ডোমেইন ফাইলটি সেই পরিবেশের সমস্ত দৃষ্টান্তের জন্য একই। এটি একই ডোমেনের অধীনে অদৃশ্য দৃষ্টান্তগুলিতে সাধারণীকরণে আমাদের কাঠামোকে ভাল করে তোলে,” হাউ ব্যাখ্যা করেন।
সিস্টেমটিকে কার্যকরভাবে সাধারণীকরণের অনুমতি দেওয়ার জন্য, গবেষকদেরকে সিমভিএলএম-এর জন্য যথেষ্ট প্রশিক্ষণের ডেটা যত্ন সহকারে ডিজাইন করতে হয়েছিল যাতে মডেলটি পরিস্থিতির নিদর্শনগুলি মুখস্থ না করে সমস্যা এবং লক্ষ্য বুঝতে শিখে। যখন পরীক্ষা করা হয়, সিমভিএলএম সফলভাবে দৃশ্যকল্প বর্ণনা করে, কর্মের প্রতীকী রূপ দেয় এবং প্রায় 85 শতাংশ পরীক্ষায় লক্ষ্য অর্জিত হয়েছিল কিনা তা সনাক্ত করে।
সামগ্রিকভাবে, VLMFP ফ্রেমওয়ার্কটি মাল্টি-রোবট সহযোগিতা এবং রোবোটিক সমাবেশ সহ ছয়টি 2D পরিকল্পনা কার্যে প্রায় 60 শতাংশ এবং দুটি 3D কার্যে 80 শতাংশের বেশি সাফল্যের হার অর্জন করেছে। এটি বেসলাইন পদ্ধতির বাইরেও 50 শতাংশেরও বেশি পরিস্থিতির জন্য বৈধ পরিকল্পনা তৈরি করেছে যা এটি আগে দেখেনি।
“বিভিন্ন পরিস্থিতিতে নিয়ম পরিবর্তিত হলে আমাদের কাঠামো সাধারণীকরণ করতে পারে। এটি আমাদের সিস্টেমকে অনেক ধরনের ভিজ্যুয়াল-ভিত্তিক পরিকল্পনা সমস্যার সমাধান করার নমনীয়তা দেয়,” প্যান যোগ করে।
ভবিষ্যতে, গবেষকরা ভিএলএমএফপিকে আরও জটিল পরিস্থিতি পরিচালনা করতে এবং ভিএলএম দ্বারা হ্যালুসিনেশন সনাক্তকরণ এবং হ্রাস করার পদ্ধতিগুলি অন্বেষণ করতে সক্ষম করতে চান।
“দীর্ঘমেয়াদে, কৃত্রিম বুদ্ধিমত্তা মডেলগুলি এজেন্ট হিসাবে কাজ করতে পারে এবং অনেক জটিল সমস্যা সমাধানের জন্য সঠিক সরঞ্জামগুলি ব্যবহার করতে পারে৷ কিন্তু সঠিক সরঞ্জামগুলির মানে কী, এবং আমরা কীভাবে এই সরঞ্জামগুলিকে একীভূত করব? এখনও অনেক দূর যেতে হবে, কিন্তু চিত্রে ভিজ্যুয়াল-ভিত্তিক পরিকল্পনা আনার মাধ্যমে, এই কাজটি একটি গুরুত্বপূর্ণ অংশ,” ফাজেল বলেছেন৷
এই কাজের জন্য অর্থায়ন করা হয়েছিল, আংশিকভাবে, MIT-IBM Watson AI ল্যাব দ্বারা।