এলএলএম অধ্যয়নগুলি রোবটকে অস্পষ্ট নির্দেশাবলী বুঝতে এবং মূল বিবরণগুলিতে ফোকাস করতে সহায়তা করে

এলএলএম অধ্যয়নগুলি রোবটকে অস্পষ্ট নির্দেশাবলী বুঝতে এবং মূল বিবরণগুলিতে ফোকাস করতে সহায়তা করে

নেপাল বনাম নামিবিয়া



এলএলএম অধ্যয়নগুলি রোবটকে অস্পষ্ট নির্দেশাবলী বুঝতে এবং মূল বিবরণগুলিতে ফোকাস করতে সহায়তা করে

কল্পনা করুন যে অদূর ভবিষ্যতে কোনো একটি গুদাম বা অফিসে কাজ করছেন এবং একজন নতুন ইন্টার্নকে তার কাজের বুনিয়াদি শিখতে সাহায্য করতে বলা হচ্ছে। ধরা: এটি একটি রোবট। তাদের শেখানোর জন্য, আপনি “দেখান এবং বলুন”-এর একটি গেম খেলতে চাইতে পারেন—অর্থাৎ, আপনি কী করছেন তা ব্যাখ্যা করার সময় বিভিন্ন উপায়ে কীভাবে কিছু করতে হয় তা শারীরিকভাবে দেখান।

ধরা যাক আপনি জুম কলের সময় আপনাকে বিরক্ত না করে রোবটটিকে আপনার টেবিলে কিছু কফি রাখতে বলেছেন। আপনি পছন্দ করেন যে রোবটটি আপনার এবং ল্যাপটপের খুব কাছাকাছি না যায় যাতে এটি আপনাকে মিটিংয়ে বিরক্ত না করে। এই আচরণটি সক্ষম করার জন্য, রোবটকে অবশ্যই এমন ডেটা দিয়ে প্রশিক্ষিত করতে হবে যা সম্পূর্ণ কাজটি স্পষ্টভাবে প্রদর্শন করে। কম্পিউটার বিজ্ঞানীরা অনেক শারীরিক প্রদর্শন রেকর্ড করে বা বিস্তৃত নির্দেশনা লিখে রোবটকে হেরফেরমূলক কাজ ব্যাখ্যা করার চেষ্টা করেছেন। কিন্তু যদি আপনার উভয়ই না থাকে, তাহলে মেশিনটি কি করতে হবে তা ভুল বোঝার সম্ভাবনা নেই।

মানুষের জন্য এই সব দেখানো এবং বলা ক্লান্তিকর, তাই MIT-এর কম্পিউটার সায়েন্স অ্যান্ড আর্টিফিশিয়াল ইন্টেলিজেন্স ল্যাবরেটরি (CSAIL)-এর গবেষকরা একটি রোবট শেখানোর প্রক্রিয়াকে স্বয়ংক্রিয়ভাবে স্বয়ংক্রিয়ভাবে নির্দেশাবলী স্পষ্ট করে এবং প্রায় পাঁচগুণ বেশি ডেমো ডেটা ব্যবহার করে। তাদের “মাস্কড ইনভার্স রিইনফোর্সমেন্ট লার্নিং” (মাস্কড আইআরএল) পদ্ধতি ব্যবহারকারীর ডেমো থেকে সংগৃহীত ডেটার উপর ভিত্তি করে অস্পষ্ট নির্দেশাবলী নির্দিষ্ট করতে একটি বড় ভাষা মডেল (LLM) ব্যবহার করে। তারপরে অন্য একটি এলএলএম একটি মোশন প্ল্যানে একটি অ্যালগরিদমকে অন্তর্ভুক্ত করার জন্য কী বিবরণ প্রয়োজন তা সংকুচিত করে, যাতে একটি রোবট নিরাপদে বাড়ি, অফিস এবং কারখানায় কাজ সম্পাদন করতে পারে।

“আমাদের দৃষ্টিভঙ্গি কার্যকর হতে পারে যখন একজন মানুষ একটি রোবটের সাথে যোগাযোগ করে কিন্তু একটি কাজের সমস্ত বিবরণ বানান করতে চায় না,” বলেছেন এমআইটি ডক্টরাল ছাত্র এবং সিএসএআইএল গবেষক মিনিয়ং হোয়াং, যিনি প্রকল্পটি প্রবর্তনকারী একটি গবেষণাপত্রের প্রধান লেখক। “আমরা মেশিনগুলিকে ব্যবহারকারীরা আসলে যা চায় তার নীচে পৌঁছানোর অনুমতি দিয়ে মানুষের প্রচেষ্টাকে হ্রাস করি।”

হোয়াং-এর মতে, মাস্কড আইআরএল রোবটকে নিরাপদে সেটিংগুলিতে চালচলনে সাহায্য করতে পারে যেখানে এমন উপাদান রয়েছে যা একজন মানুষ নির্দেশে বর্ণনা করতে পারে না, তবে তা অপরিহার্য। উদাহরণস্বরূপ, একটি মেশিন যেটি আপনাকে রান্নাঘর থেকে একটি জলখাবার নিয়ে আসে তা হয়ত জানে না কীভাবে আপনার ল্যাপটপে বিধ্বস্ত হওয়া এড়াতে হয়। এছাড়াও, একটি ফ্যাক্টরি রোবট যা বিভিন্ন বাক্সে আইটেম রাখে তাকে অবশ্যই সাবধানে তাকগুলির চারপাশে নেভিগেট করতে হবে।

এই পরিস্থিতিতে নতুন কাজ শিখতে, মাস্কড আইআরএল তার পরিবেশ সম্পর্কে তথ্য ক্যাপচার করতে রোবটের সেন্সর ব্যবহার করে। এই উপাদানগুলি একটি কাইনেস্থেটিক প্রদর্শনের প্রতিটি নড়াচড়াও রেকর্ড করে – একটি প্রশিক্ষণ পদ্ধতি যেখানে একজন ব্যক্তি শারীরিকভাবে একটি রোবটকে একটি নির্দিষ্ট ক্রিয়া সম্পাদন করতে চালিত করে। এটা অনেকটা মেশিনের ফিজিওথেরাপিস্ট হওয়ার মতো, একটি নির্দিষ্ট দিকে জয়েন্ট বাঁকানো রোবটকে দেখানোর জন্য কীভাবে বস্তুকে ধরতে হয়, সরাতে হয় এবং স্থাপন করতে হয়।

এমআইটি-এর সিস্টেম তারপরে সংক্ষিপ্ততম সম্ভাব্য পথে চলাফেরার এই ক্রমটি (যাকে ট্র্যাজেক্টোরি বলা হয়) তুলনা করার জন্য এলএলএমকে কল করে। নির্দেশনায় যা অস্পষ্ট হতে পারে তার উপরও মডেলটি প্রসারিত করে, “কাছে থাকুন” এর মতো অনুরোধটিকে “টেবিলের পৃষ্ঠের কাছাকাছি থাকুন” এ পরিণত করে৷ ট্র্যাজেক্টোরিজ তুলনা করে এবং দিকনির্দেশ স্পষ্ট করে, এলএলএম বুঝতে শুরু করে যে কেন সে যে আন্দোলনগুলি অনুশীলন করছে তা কাজের জন্য গুরুত্বপূর্ণ।

একটি দ্বিতীয় এলএলএম তারপর পরিবেশের বিশদ অনুমান করে, যেমন বাধার অবস্থান এবং রোবটের লক্ষ্য বস্তুর আকার। এই প্রক্রিয়া চলাকালীন, তিনি “ছদ্মবেশে” (অন্য কথায়, উপেক্ষা করেন) যে উপাদানগুলিকে তিনি হাতের কাজের সাথে অপ্রাসঙ্গিক মনে করেন, প্রতিটিকে “1” (গুরুত্বপূর্ণ) বা “0” (এত বেশি নয়) হিসাবে স্কোর করেন। উদাহরণস্বরূপ, ডেমো চলাকালীন একজন ব্যবহারকারী একটি টেবিলের উপর ঝুঁকেছেন কিনা তা “0” হবে, এটি অপ্রাসঙ্গিক করে তোলে। একটি “1” হিসাবে গণনা করা প্রতিটি বিবরণ একটি অ্যালগরিদম দ্বারা চূড়ান্ত কর্ম পরিকল্পনায় অন্তর্ভুক্ত করা হয়৷

এই মুখোশগুলি মাস্কড আইআরএলকে 3D এবং বাস্তব-জগতের ডেমো উভয় ক্ষেত্রেই একই ধরনের বেসলাইনের উপর একটি মূল সুবিধা দিয়েছে, কারণ তারা একটি রোবটকে শিখিয়েছে কোন তথ্যকে অগ্রাধিকার দিতে হবে। গবেষকদের সিস্টেমের জন্য ধন্যবাদ, ভার্চুয়াল এবং বাস্তব উভয় রোবটই দক্ষতার সাথে বাধাগুলির চারপাশে বস্তুগুলিকে চালিত করতে সক্ষম হয়েছিল, যেমন একটি ল্যাপটপের চারপাশে একটি কফির মগ টেবিলের বিভিন্ন স্থানে সরানো। এই কাজগুলিতে, মাস্কড আইআরএল সঠিকভাবে ব্যবহারকারীর পছন্দগুলি চিহ্নিত করেছে, যা তারা তাদের নির্দেশাবলীতে স্পষ্টভাবে জানায়নি, সংশ্লিষ্ট বেসলাইনের তুলনায় প্রায় 15 শতাংশ বেশি।

সিমুলেশন পরীক্ষা-নিরীক্ষার সময়, CSAIL গবেষকরা দেখতে পান যে মাস্কড আইআরএল দ্রুত শিখেছে। কাপটিকে তার বেসলাইনের তুলনায় কীভাবে সরানো যায় তা বের করতে কম প্রদর্শনী লেগেছে। তারা আরও দেখেছে যে মেশিনটি একটি অস্পষ্ট অনুরোধ অনুসরণ করার চেষ্টা করার পরিবর্তে এলএলএম নির্দেশাবলী সাফ করার সময় রোবটগুলি আরও ভাল পারফর্ম করেছে।

এই আরও ফোকাসড পদ্ধতিটি একটি বাস্তব রোবোটিক বাহুতেও ভালভাবে অনুবাদ করেছে, নির্দেশনাগুলি বহন করে যা সিস্টেমটি তার প্রশিক্ষণ পর্বে দেখেনি। 50টি কাইনেস্থেটিক প্রদর্শনে প্রশিক্ষণ নেওয়ার পর, ব্যবহারকারীর কম্পিউটারের সাথে সংঘর্ষ এড়ানোর সময় রোবটটি সাবধানে একজন ব্যক্তির দিকে একটি কাপ সরিয়ে নিয়েছিল-একটি বাধা যা “দূরে রাখতে” একটি আরও সাধারণ অনুরোধ বানান করে এড়াতে শিখেছে। তিনি “কাছে থাকার” সময় একটি টেবিল মুছে ফেলেন এবং ব্যক্তি এবং টেবিল উভয়ের কাছ থেকে “দূরে” যাওয়ার সময় ব্যবহারকারীকে চিপসের একটি ব্যাগ দেন।

মুখোশধারী আইআরএল ব্যবহারকারীরা যা কিছু না বলে ফেলেন তা টের পান এবং ব্যাখ্যা করেন, কিন্তু শীঘ্রই, তিনিও এটি “দেখতে” পারেন৷ CSAIL গবেষকরা রোবটটিকে ক্যামেরা দিয়ে সজ্জিত করে তাদের পদ্ধতিকে আরও গতিশীল করার পরিকল্পনা করেছেন, যা রোবটটিকে তার চারপাশের ছবি তুলতে দেয়। তাই এটি হাইলাইট করতে পারে এবং কাছাকাছি নির্দিষ্ট উপাদানগুলিতে ফোকাস করতে পারে। উদাহরণস্বরূপ, আপনি যদি মেশিনটিকে একটি খেলনা নিতে বলেন, তাহলে এটি কাছাকাছি কিছু কলা দেখতে পারে এবং তার লক্ষ্যবস্তু পরিচালনা করার আগে সেগুলিকে উপেক্ষা করতে পারে।

হোয়াং তিন CSAIL সহকর্মীর সাথে কাগজটি লিখেছেন: ডক্টরাল ছাত্র আলেকজান্দ্রা ফোরসি-স্মর্ক ’20, এসএম ’22; পোস্টডক্টরাল সহকর্মী নাথানিয়েল ডেনলার; এবং এমআইটি সহকারী অধ্যাপক আন্দ্রেয়া বোবো, যিনি অ্যারোনটিক্স এবং অ্যাস্ট্রোনটিক্স এবং CSAIL বিভাগের সদস্য। MIT জেনারেটিভ এআই ইমপ্যাক্ট কনসোর্টিয়াম অ্যাওয়ার্ড এবং প্রতিরক্ষা মন্ত্রকের মাধ্যমে টাটা গ্রুপের আংশিকভাবে তাদের কাজ সমর্থন করেছিল। তারা জুন মাসে রোবোটিক্স এবং অটোমেশনের 2026 IEEE আন্তর্জাতিক সম্মেলনে প্রকল্পটি উপস্থাপন করবে।



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *