এআই এজেন্টরা রোবটদের প্রয়োজনীয় প্রশিক্ষণের ডেটা পেতে সাহায্য করার জন্য ভার্চুয়াল খেলার মাঠ তৈরি করে

এআই এজেন্টরা রোবটদের প্রয়োজনীয় প্রশিক্ষণের ডেটা পেতে সাহায্য করার জন্য ভার্চুয়াল খেলার মাঠ তৈরি করে

নেপাল বনাম নামিবিয়া



এআই এজেন্টরা রোবটদের প্রয়োজনীয় প্রশিক্ষণের ডেটা পেতে সাহায্য করার জন্য ভার্চুয়াল খেলার মাঠ তৈরি করে

রোবটরা রাস্তায় হাঁটা, বিস্মিত দর্শকদের দ্বারা বেষ্টিত, একটি ক্রমবর্ধমান সাধারণ দৃশ্য। তবে এই মেশিনগুলি এখনও রান্নাঘর বা কারখানায় আপনি যা কাজ করতে চান তা করার জন্য সাহায্যকারী নয় এবং একটি বড় বাধা হ’ল ডেটা। মানুষের মতো, রোবটও অভিজ্ঞতা থেকে সেরা শেখে। চ্যালেঞ্জ হল এই মেশিনগুলিকে বিভিন্ন সেটিংসে এতগুলি অপারেশন শারীরিকভাবে শেখানো শ্রমসাধ্য এবং সময়সাপেক্ষ।

“একটি প্রাকৃতিক ধারণা হল সিমুলেশনকে প্রশিক্ষণের ক্ষেত্র হিসাবে ব্যবহার করা। যদিও রোবটিক সিমুলেটরগুলিকে চালিত করে এমন পদার্থবিদ্যার ইঞ্জিনগুলিতে গত কয়েক বছরে উল্লেখযোগ্য অগ্রগতি হয়েছে, বাকি চ্যালেঞ্জগুলির মধ্যে একটি হল সিমুলেশন সামগ্রী তৈরি করা যা বাস্তব জগতের জটিলতা ক্যাপচার করার জন্য যথেষ্ট বৈচিত্রপূর্ণ,” বলেছেন Russ Tedrake, Toyota Professor of Electrical Engineering and Computer Engineering AEE (CSEE) মহাকাশচারী। এমআইটি কম্পিউটার সায়েন্স অ্যান্ড আর্টিফিশিয়াল ইন্টেলিজেন্স ল্যাবরেটরি (সিএসএআইএল)।

এটি দেখা যাচ্ছে যে কৃত্রিম বুদ্ধিমত্তা এজেন্ট, বা আধা-স্বায়ত্তশাসিত সফ্টওয়্যার যা “চিন্তা করে” এবং সু-সংজ্ঞায়িত কাজগুলি সম্পূর্ণ করে, রোবটগুলির প্রয়োজনীয় বাস্তবসম্মত ভার্চুয়াল সেটিংস তৈরি করতে সহায়তা করতে পারে। এমআইটি সিএসএআইএল এবং টয়োটা রিসার্চ ইনস্টিটিউটের গবেষকদের দ্বারা তৈরি নতুন “সিনেস্মিথ” সিস্টেমটি একটি 3D দৃশ্যের বস্তু, দেয়াল এবং সামগ্রিক চেহারাকে একত্রিত করতে তিনটি এজেন্ট ব্যবহার করে। রেস্তোরাঁ, শয়নকক্ষ এবং হোটেলের মতো অন্দর স্থানগুলির বিনোদনগুলি পূর্ববর্তী সিস্টেমগুলির তুলনায় আরও বাস্তবসম্মত এবং বিশদ, যা রোবটকে দক্ষতা অনুশীলন করতে সহায়তা করে এবং সক্রিয় হওয়ার আগে বিভিন্ন কাজ সম্পাদন করার চেষ্টা করে৷ পরিবর্তে, প্রকৌশলীরা বাস্তব-বিশ্বের পরীক্ষায় সময় বাঁচান।

এজেন্টদের ধারণা থাকে যে প্রতিদিনের স্থানগুলি কেমন দেখতে হবে কারণ তারা প্রত্যেকে ভিজ্যুয়াল ল্যাঙ্গুয়েজ মডেল (ভিএলএম), বিশেষ করে উন্নত ভিএলএম GPT-5.2 নামে একটি মাল্টিমোডাল সিস্টেমে কল করে। এটি আরও ভিজ্যুয়াল প্রম্পট পরিচালনা করার জন্য ওয়েব থেকে প্রচুর পাঠ্য এবং চিত্রের উপর প্রশিক্ষিত। এই উন্নত মডেলটি প্রতিটি এজেন্টকে কিছু ধরণের স্থানিক জ্ঞান দেয়: প্রথমে, একজন “ডিজাইনার” এজেন্ট একটি দৃশ্যের উপাদান তৈরি করে, তারপর একজন “সমালোচক” পরামর্শ দেন যদি এটি বাস্তবসম্মত মনে হয়, এবং অবশেষে, একজন “অর্কেস্ট্রেটর” রাউন্ড-ট্রিপ পরিচালনা করে, ডিজাইন কখন করা হবে তা নির্ধারণ করে। তিনটি VLM তাদের সৃজনশীল সহযোগিতা সম্পূর্ণ করার পরে, দৃশ্যটি সরাসরি পদার্থবিদ্যা সিমুলেশন সফ্টওয়্যারে লোড করার জন্য প্রস্তুত।

“আমরা দেখেছি যে সিস্টেমটি মানুষের ডিজাইনারের মতো 3D দৃশ্য তৈরি করতে পারে,” বলেছেন MIT EECS ডক্টরাল ছাত্র নিকোলাস ফাফ, একজন CSAIL গবেষক এবং Tedrake এর সাথে একটি গবেষণাপত্রের প্রধান লেখক কাজটি উপস্থাপন করেছেন৷ “আমরা একটি নেতৃস্থানীয় VLM ব্যবহার করে 1,300 টিরও বেশি দৃশ্য করেছি যার ওয়েব-স্কেল পূর্বসূরি রয়েছে, এবং এটি উন্মত্ত সৃজনশীল এবং বৈচিত্র্যময় ব্যবস্থা করেছে। আমি সিস্টেমকে নির্দেশ দিয়ে এটি করতে শেখাইনি, এটি কেবল ইম্প্রোভাইজ করা হয়েছে।”

আমার এজেন্টের সাথে কথা বলুন

VLM এজেন্টদের ধন্যবাদ, আপনি SeneSmith-কে “গাড়ি, একটি ওয়ার্কবেঞ্চ, কোণে স্তূপ করা টায়ার এবং দেয়ালে একটি মই দিয়ে একটি গ্যারেজ তৈরি করতে” এবং একটি রোবটের সাথে টিঙ্কার করার জন্য বস্তু সমৃদ্ধ একটি ভার্চুয়াল খেলার মাঠ পেতে বলতে পারেন৷ এই কক্ষগুলি পূর্ববর্তী পদ্ধতির তুলনায় প্রতি দৃশ্যে ছয়গুণ বেশি আইটেম দিয়ে ডিজাইন করা হয়েছে, যা রোবটদের সিঙ্কে একটি গ্লাস রাখা, প্লেটে ফল রাখা এবং একটি শেল্ফ থেকে একটি টেবিলে সোডার ক্যান সরানোর মতো দক্ষতা শিখতে সাহায্য করার জন্য আদর্শ করে তুলেছে৷

আপনার নখদর্পণে অনেক সমৃদ্ধ ভার্চুয়াল পরিবেশের সাথে, আপনি মূল্যায়ন করতে পারেন যে আপনার রোবটটি ভৌত ​​জগতে যতটা পরীক্ষা এবং ত্রুটি ছাড়াই স্থাপনার জন্য প্রস্তুত কিনা। গবেষকরা সিনস্মিথের ডিজিটাল বিশ্বে বিভিন্ন কর্ম পরিকল্পনা (যাকে “নীতি”ও বলা হয়) পরীক্ষা করেছেন, প্রক্রিয়াটিতে 100টি অনন্য স্থান তৈরি করেছেন। একজন ভিএলএম এজেন্ট প্রতিটি প্রচেষ্টার মূল্যায়ন করেছেন, এবং তিনি আবিষ্কার করেছেন যে রোবটের প্রোগ্রামগুলি ত্রুটিপূর্ণ ছিল, মেশিনটি প্রায়শই তার কাজগুলিতে ব্যর্থ হয়। মানুষ 99 শতাংশেরও বেশি সময় মডেলের রায়ের সাথে একমত, যা রোবটবিদদের বাস্তব জগতে একটি রোবট সরানোর আগে সিমুলেশনে ত্রুটিপূর্ণ পদ্ধতিগুলি দূর করতে সাহায্য করতে পারে।

কিন্তু এই ভার্চুয়াল জগতগুলো কতটা বাস্তবসম্মত? এটি নিশ্চিতভাবে প্রমাণ করা কঠিন হতে পারে, তাই গবেষকরা বিভিন্ন কোণ থেকে প্রশ্নটির সাথে যোগাযোগ করেছেন। সবচেয়ে গুরুত্বপূর্ণ পরীক্ষা: তারা একটি প্রাক-প্রশিক্ষিত রোবট নীতি বাদ দিয়েছে—একটি AI নিয়ন্ত্রক যা প্রাথমিকভাবে বাস্তব-বিশ্বের ডেটার উপর প্রশিক্ষিত যেটি কখনও কোনো SceneSmith দৃশ্য দেখেনি—উত্পন্ন পরিবেশে। একটি পরীক্ষায়, ব্যবহারকারীরা সিস্টেমকে বলেছিল “বাটি থেকে আপেলটি নিয়ে এটিকে কাটিং বোর্ডে রাখতে” এবং সিমুলেটেড রোবটটি ঠিক তাই করেছে। যদি দৃশ্যগুলি বাস্তব সেটিংসের সাথে খুব মিল না হয় যেখান থেকে নীতিটি শেখা হয়েছিল, তবে এটি কাজ করবে না৷

দলটি ভার্চুয়াল স্পেসগুলির মাধ্যমে রোবটগুলিকেও স্থানান্তরিত করে, তাদের ক্যাবিনেটগুলি খুলতে, বোতল রাখতে এবং কক্ষগুলির মধ্যে নেভিগেট করার নির্দেশ দেয়। তাদের পরীক্ষাগুলি প্রকাশ করেছে যে পরিবেশগুলি দীর্ঘস্থায়ী শারীরিক মিথস্ক্রিয়ায় ধরে রাখে এবং চাক্ষুষ পরিদর্শনের বাইরে প্রসারিত হয়।

পর্দার আড়ালে

সিনস্মিথ যে এজেন্টগুলি ব্যবহার করে তাদের প্রত্যেকের সৃজনশীল প্রক্রিয়ায় একটি সুনির্দিষ্ট ভূমিকা রয়েছে, যা পর্যায়ক্রমে দৃশ্য গঠন করে। তারা মূলত একটি মেঝে পরিকল্পনা তৈরি করে এবং এটিকে জীবন্ত করে তোলে।

ধরা যাক আপনি একটি বাড়ির প্রথম তলার মতো একটি দৃশ্য তৈরি করতে চেয়েছিলেন। “ডিজাইনার” VLM একটি সাধারণ লেআউট দিয়ে শুরু হবে, যা “অডিটর” পর্যালোচনা করে এবং তারপর “অর্কেস্ট্রেটর” সাইন অফ করে। এজেন্টরা প্রতিটি পর্যায়ে এই পদ্ধতির পুনরাবৃত্তি করে: আসবাবপত্র যোগ করা, দেয়াল এবং তারপর সিলিংয়ে বস্তু স্থাপন করা এবং অবশেষে, রোবটগুলি হেরফের করতে পারে এমন বস্তুগুলি ফেলে দেওয়া। উদাহরণস্বরূপ, VLM গুলি ক্যাবিনেট যোগ করতে পারে যা রোবটগুলি খুলতে এবং বন্ধ করতে পারে – একটি উচ্চারিত আইটেম, যা পূর্ববর্তী বেসলাইনে প্রায়শই ছিল না।

প্রতিটি ধাপে, দ্বিতীয় ভিএলএম নিশ্চিত করে যে দৃশ্যটি ব্যবহারিক, এবং উদাহরণ স্বরূপ, বসার ঘর থেকে একটি বাথটাব সরানোর পরামর্শ দেয়। তৃতীয় ভিএলএম নিশ্চিত করে যে একটি উচ্চ-মানের দৃশ্য তৈরি করা হয়েছে, এমনকি ভিজ্যুয়ালগুলি সঠিক না হলে ডিজাইন প্রক্রিয়াটিকে কয়েকটা বাঁক নিয়ে যেতে পারে। একবার তিনটি VLM তাদের সৃজনশীল সহযোগিতা সম্পূর্ণ করে, সিমুলেশন সফ্টওয়্যার ব্যবহার করে ভৌত জগতের মেকানিক্স যোগ করা হয়।

কক্ষগুলি কেমন হওয়া উচিত, কোথায় বস্তুগুলি স্থাপন করা উচিত এবং বাস্তব-বিশ্বের পদার্থবিদ্যা সম্পর্কে ভাল বোঝার সাথে, সিনস্মিথের পূর্ববর্তী পদ্ধতিগুলির তুলনায় একটি স্বতন্ত্র সুবিধা রয়েছে। “এইচএসএম” এবং “হোলোডেক” এর মতো সিন জেনারেশন বেসলাইনের তুলনায়, সিনস্মিথ একটি ব্যক্তিগত অফিস, একটি মৃৎশিল্পের দোকান এবং এমনকি একটি মাইনক্রাফ্ট-থিমযুক্ত প্লেরুম সহ আরও অনেক বস্তুর সাথে পরিবেশ তৈরি করেছে।

SceneSmith 200 টিরও বেশি ব্যবহারকারীদের মধ্যে একটি প্রিয় ছিল। তারা দেখেছে যে সিস্টেমের ভিজ্যুয়ালগুলি সময়ের 90 শতাংশ বেশি বাস্তবসম্মত। তারা আরও লক্ষ্য করেছে যে এটি সাধারণত অন্যান্য পদ্ধতির তুলনায় আরও ঘনিষ্ঠভাবে নির্দেশাবলী অনুসরণ করে। অন্য কথায়, ব্যবহারকারীরা সত্যিই দেখতে চেয়েছিলেন এমন ভার্চুয়াল খেলার মাঠ তৈরিতে এটি সেরা ছিল।

অনেক প্রতিভা একটি সিস্টেম

বাস্তবতা, বৈচিত্র্য এবং সমৃদ্ধি দৃশ্যস্মিথের জন্য শক্তিশালী বৈশিষ্ট্য, এমনকি যখন এটি পৃথক 3D বস্তু তৈরির ক্ষেত্রে আসে। আপনি এটিকে একটি রোলিং সার্ভিং কার্ট তৈরি করতে বলতে পারেন, এবং এটি একটি 2D চিত্র তৈরি করবে যা ভর, ​​ঘর্ষণ এবং জড়তার মতো ভৌত বৈশিষ্ট্য সহ একটি বিশদ মডেলে পরিণত হবে৷

যাইহোক, যেমন একটি বিস্তারিত প্রক্রিয়া একটি গতি বাণিজ্য বন্ধ সঙ্গে আসে. এজেন্ট প্রতিটি বস্তু তৈরি এবং ঘনিষ্ঠভাবে পরীক্ষা করার কারণে একটি দৃশ্য তৈরি করতে কয়েক ঘন্টা সময় লাগতে পারে। আরও কম্পিউটিং শক্তির সাথে, সিস্টেমটি দক্ষতায় নাটকীয় বৃদ্ধি দেখতে পারে। বিস্তৃত 3D লাইব্রেরি উপলভ্য হলে CSAIL প্রকৌশলীরাও বিকৃত বস্তুতে (স্পঞ্জের মতো) প্রসারিত হওয়ার আশা করেন।

“সিনেস্মিথ এই বিষয়ে একটি উল্লেখযোগ্য অগ্রগতির প্রতিনিধিত্ব করে শুধুমাত্র একটি সাধারণ পাঠ্য প্রম্পট থেকে সিমুলেশন-প্রস্তুত অন্দর পরিবেশ তৈরি করার জন্য একটি এজেন্টিক কাঠামো প্রদান করে,” বলেছেন জেরেমি বিনাগিয়া, অ্যামাজন রোবোটিক্সের একজন অ্যাপ্লিকেশন বিজ্ঞানী যিনি গবেষণায় জড়িত ছিলেন না। “এটি শিল্পের অবস্থাকে বিভিন্ন উপায়ে অগ্রসর করে, যার মধ্যে রয়েছে সিমুলেটেড পরিবেশে বস্তুর ঘনত্বের সীমানা ঠেলে দেওয়া, নিশ্চিত করা যে সমস্ত বস্তু শারীরিকভাবে নির্ভুল (বনাম শুধুমাত্র দৃশ্যত বাস্তবসম্মত), এবং এমন সম্পদ তৈরি করা যা একটি নির্দিষ্ট লাইব্রেরির মধ্যে সীমাবদ্ধ নয়, কারণ সেগুলি 3D-তে পাঠ্য ব্যবহার করে তৈরি করা যেতে পারে।”

Pfaff এবং Tedrake থমাস কোহন SM’24, একজন MIT ডক্টরাল ছাত্র এবং CSAIL গবেষকের সাথে গবেষণাপত্রটি লিখেছেন; এবং টয়োটা রিসার্চ ইনস্টিটিউট রোবোটিক্স, সের্গেই জাখারভ এবং রিক কারি এসএম ’08, পিএইচডি ’10। তাদের কাজ অন্যদের মধ্যে অ্যামাজন, ইউএস অফিস অফ নেভাল রিসার্চ, টয়োটা রিসার্চ ইনস্টিটিউট এবং ইউএস ন্যাশনাল সায়েন্স ফাউন্ডেশন দ্বারা সমর্থিত ছিল।

দলটি গত সপ্তাহে মেশিন লার্নিং-এর আন্তর্জাতিক সম্মেলনে স্পটলাইট হিসাবে তাদের ফলাফল উপস্থাপন করেছে।



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *