কৃত্রিম বুদ্ধিমত্তা কি বলতে পারে আপনি আপনার চাবি কোথায় রেখে গেছেন?

কৃত্রিম বুদ্ধিমত্তা কি বলতে পারে আপনি আপনার চাবি কোথায় রেখে গেছেন?

নেপাল বনাম নামিবিয়া



কৃত্রিম বুদ্ধিমত্তা কি বলতে পারে আপনি আপনার চাবি কোথায় রেখে গেছেন?

একজন স্বয়ংক্রিয় কারখানার কর্মী স্টোরেজ বিনের কথা মনে করতে পারেন যেখানে তিনি আগের রাতে একটি আংশিকভাবে একত্রিত উপাদান রেখেছিলেন এবং দ্রুত সেই স্থানে ফিরে আসতে পারেন। কিন্তু রোবটগুলি যেগুলি তার সাথে পাশাপাশি কাজ করতে পারে তারা একই ধরণের “স্প্যাটিও-টেম্পোরাল” মেমরি বিকাশ এবং অ্যাক্সেস করতে লড়াই করবে।

এখন, এমআইটি গবেষকরা একটি দীর্ঘমেয়াদী মেমরি ফ্রেমওয়ার্ক তৈরি করেছেন যা রোবটগুলিকে দ্রুত জটিল বড় আকারের পরিবেশের একটি বিশদ মানসিক মডেল তৈরি করতে এবং স্মরণ করতে দেয়।

ভবিষ্যতে, এই অগ্রগতি একজন কারখানার কর্মীকে আইটেমটি আনার জন্য একটি রোবোটিক সহকারীকে পাঠানোর অনুমতি দিতে পারে, কেবল এটিকে “গত রাতে আমরা যে উপাদানটি একত্রিত করতে শুরু করেছি তা ধরতে যান।”

এই নতুন পদ্ধতিটি পরিবেশের সমৃদ্ধ বর্ণনার সাথে উন্নত মানচিত্রের উপস্থাপনাকে একত্রিত করে যা রোবটটি দীর্ঘ সময় ধরে ভ্রমণ করার সময় সংগ্রহ করে। রোবট সহজ ভাষায় এর পরিবেশ সম্পর্কে জটিল প্রশ্নের উত্তর দিতে এই মেমরিটি দ্রুত অ্যাক্সেস করতে পারে।

এই মেমরি ফ্রেমওয়ার্ক, যা উন্নত পদ্ধতির চেয়ে আরও সঠিকভাবে প্রশ্নের উত্তর দেয়, একটি মোবাইল রোবট রিয়েল টাইমে ব্যবহারের জন্য যথেষ্ট দ্রুত চলে।

রোবোটিক্সে এর সম্ভাব্য ব্যবহার ছাড়াও, এই পদ্ধতিতে অগমেন্টেড রিয়েলিটি সিস্টেমে অ্যাপ্লিকেশন থাকতে পারে যা রক্ষণাবেক্ষণ কর্মীদের অসঙ্গতি শনাক্ত করতে বা পথ খুঁজে বের করতে যাত্রীদের সহায়তা করতে সহায়তা করে।

“আমরা যদি চাই যে রোবট মানুষের সাথে পাশাপাশি কাজ করুক এবং মানুষের সাথে আরও ভাল যোগাযোগ করুক, তাদের অবশ্যই একই ভাষায় কথা বলতে হবে। রোবটকে অবশ্যই মানুষের মতো সময় এবং স্থান সম্পর্কে চিন্তা করতে সক্ষম হতে হবে। আমাদের পদ্ধতিটি মূলত এটিই করে। এটি একটি ঐতিহ্যগত মানচিত্রকে একটি ভাষা-ভিত্তিক মানচিত্রে পরিণত করছে যা একটি রোবটের পক্ষে চিন্তা করা এবং ভাষার মাধ্যমে অ্যাক্সেস করা সহজ,” বলেছেন লুকা কার্লোনা, আইটি বিভাগের একজন সহকারী অধ্যাপক আইটি-এর এম. (AeroAstro), ল্যাবরেটরি ফর ইনফরমেশন অ্যান্ড ডিসিশন সিস্টেমের (LIDS) প্রধান তদন্তকারী এবং এমআইটি স্পার্ক ল্যাবরেটরির পরিচালক।

এমআইটি-তে স্নাতক ছাত্র, প্রধান লেখক নিকোলাস গোর্লো কাগজে তার সাথে যোগ দিয়েছেন; এবং লাক্স শ্মিড, এমআইটির একজন প্রাক্তন গবেষণা বিজ্ঞানী এবং বর্তমানে জার্মানির নুরেমবার্গ ইউনিভার্সিটি অফ টেকনোলজির অধ্যাপক। গবেষণাটি সম্প্রতি কম্পিউটার ভিশন অ্যান্ড প্যাটার্ন রিকগনিশন (সিভিপিআর) সম্মেলনে উপস্থাপন করা হয়।

স্পেটিও-টেম্পোরাল মেমরি

মেমরি একটি কৃত্রিম বুদ্ধিমত্তা সিস্টেমকে অনুমতি দেয়, যেমন একটি চ্যাটবট, জটিল প্রশ্নের উত্তর দিতে এবং এর ব্যবহারকারীর সাথে পূর্ববর্তী মিথস্ক্রিয়া সম্পর্কে চিন্তা করতে।

“আমরা একটি নতুন ধরনের মেমরি ডিজাইন করতে চাই, স্প্যাটিও-টেম্পোরাল মেমরি, যা একটি AI-চালিত রোবটকে বাস্তব মিথস্ক্রিয়া এবং সেন্সর পর্যবেক্ষণগুলি মনে রাখতে দেয়৷ ChatGPT-এর মতো, কিন্তু বাস্তব জগতে স্থাপিত এবং পরিবেশ সম্পর্কে যে কোনও প্রশ্নের উত্তর দিতে সক্ষম, যেমন ‘আমি আমার মানিব্যাগটি কোথায় রেখেছিলাম?'” কার্লন বলেছেন৷

এই ধরনের একটি মেমরি ফ্রেমওয়ার্ক বিকাশের জন্য, এমআইটি গবেষকরা কাজের দুটি লাইন তৈরি করেছেন: কম্পিউটার দৃষ্টি এবং রোবোটিক ম্যাপিং।

মাল্টিমোডাল কম্পিউটার ভিশন মডেলগুলি একটি দৃশ্যের বস্তুগুলিকে সমৃদ্ধভাবে বুঝতে এবং বর্ণনা করতে পারে, তবে তারা প্রায়শই একটি সময়ে শুধুমাত্র একটি টীকা প্রক্রিয়া করে। অন্যদিকে, রোবোটিক ম্যাপিং ফ্রেমওয়ার্ক একটি পরিবেশের 3D মানচিত্র তৈরি করে, যেমন একটি সম্পূর্ণ অ্যাপার্টমেন্ট বা একটি বিশ্ববিদ্যালয় ক্যাম্পাস, কিন্তু সাধারণত বস্তুর বিশদ বিবরণের অভাব থাকে বা গণনাগতভাবে ব্যয়বহুল।

এমআইটি গবেষকদের দ্বারা তৈরি করা পদ্ধতি, যাকে ডিসক্রাইব এনিথিং, এনিহোয়ার, এনিটাইম, অ্যাট এনি মোমেন্ট (ডিএএএএম) বলা হয়, উভয় পদ্ধতির মধ্যেই সবচেয়ে ভালো লাগে।

DAAAM ব্যবহার করে, একটি রোবট যখন তার পরিবেশ অতিক্রম করে, এটি যে বস্তুগুলি দেখে তার সাথে সমৃদ্ধ বর্ণনা সংযুক্ত করে। উদাহরণস্বরূপ, রোবটটি লক্ষ্য করতে পারে যে এমআইটি ক্যাম্পাসের একটি নির্দিষ্ট বিল্ডিংকে স্ট্যাটা সেন্টার বলা হয় এবং এটি একটি নির্দিষ্ট ধরণের আর্কিটেকচার দিয়ে ডিজাইন করা হয়েছে, বা একটি বাইকের র‌্যাকে পাঁচটি বাইক রয়েছে এবং লাল রঙের একটি ফ্ল্যাট টায়ার রয়েছে৷

এটি একটি 3D মানচিত্র-ভিত্তিক উপস্থাপনায় এই বিস্তারিত তথ্য সঞ্চয় করে যা স্থানিকভাবে অর্ডার করা হয় যাতে বস্তুগুলিকে পৃথক অঞ্চলে গোষ্ঠীভুক্ত করা হয়। এইভাবে রোবট মনে রাখতে পারে যে পাংচারযুক্ত লাল বাইকটি স্ট্যাটা সেন্টারের বাইরে বাইকের র‌্যাকে রয়েছে।

কিন্তু বিদ্যমান কৌশলগুলি যা এই ধরনের সমৃদ্ধ বর্ণনাগুলিকে ক্যাপচার করে সাধারণত কয়েকটি বস্তুকে টীকা করতে কয়েক সেকেন্ড সময় নেয়। এটি রিয়েল-টাইম পারফরম্যান্সের জন্য খুব ধীর, কারণ একটি রোবট কয়েক মিনিটের অন্বেষণের সময় শত শত বস্তু দেখতে পারে।

“রোবট যত দ্রুত এই স্থানিক মেমরি তৈরি করতে পারে, পরিবেশে কর্ম সম্পাদনে এটি তত বেশি দক্ষ হবে,” কার্লন যোগ করেছেন।

প্রক্রিয়া স্ট্রিমলাইনিং

জিনিসগুলিকে গতি বাড়ানোর জন্য, DAAAM ফ্লাইতে কাছাকাছি বস্তু সংগ্রহ করে এবং টীকাগুলির জন্য কী ফ্রেমগুলি নির্বাচন করতে একটি অপ্টিমাইজেশন পদ্ধতি ব্যবহার করে৷ এগুলি হল একাধিক বস্তুর খুব স্পষ্ট দৃশ্য সহ চিত্র, যা সিস্টেমটিকে একই সময়ে বেশ কয়েকটি আইটেম পুঙ্খানুপুঙ্খভাবে বর্ণনা করতে দেয়, গণনা দশগুণ গতি বাড়িয়ে দেয়।

রোবট স্থানটি অন্বেষণ করার সাথে সাথে এটি 3D মানচিত্রে একটি নির্দিষ্ট স্থানে একাধিক অবজেক্টের সাথে টীকাগুলির প্রতিটি ব্যাচ সংযুক্ত করে।

“আমরা প্রতিটি বস্তুকে শুধুমাত্র একবার চিহ্নিত করি, তাই আমাদের কাঠামো বাস্তব সময়ে খুব বড় আকারের পরিবেশে কাজ করতে পারে৷ এবং বস্তুগুলিকে অঞ্চলগুলিতে গোষ্ঠীবদ্ধ করে, এটি পরিবেশে বস্তু এবং অবস্থান সম্পর্কে বিভিন্ন ধরণের প্রশ্নের উত্তর দিতে পারে,” গৌরলো ব্যাখ্যা করে৷

একবার সিস্টেমটি এই স্থানিক মেমরি তৈরি করে, এটিকে অবশ্যই বস্তু এবং বর্ণনার একটি বিশাল ডাটাবেস থেকে দক্ষতার সাথে তথ্য পুনরুদ্ধার করতে হবে।

এটি সম্ভব করার জন্য, গবেষকরা একটি এলএলএম ব্যবহার করেছেন যা বিভিন্ন সরঞ্জামগুলিতে কল করে যা দ্রুত নির্দিষ্ট তথ্য পুনরুদ্ধার করতে পারে এমন একটি উপায় যা হ্যালুসিনেশন হ্রাস করে। এটি DAAAM কে মাত্র কয়েক সেকেন্ডের মধ্যে ব্যবহারকারীর প্রশ্নের সঠিক উত্তর দিতে দেয়।

উদাহরণস্বরূপ, যদি একটি রোবটকে একটি এমআইটি ক্যাম্পাস ভবনের কাছে দেখা একটি নির্দিষ্ট মূর্তি সম্পর্কে জিজ্ঞাসা করা হয়, তবে DAAAM “মূর্তি” শব্দের উপর ভিত্তি করে তথ্য পুনরুদ্ধার করতে বা বিল্ডিংয়ের অবস্থানের উপর ভিত্তি করে তথ্য পুনরুদ্ধার করার জন্য অন্য একটি টুল ব্যবহার করতে পারে।

যখন পরীক্ষা করা হয় এবং অন্যান্য পদ্ধতির সাথে তুলনা করা হয়, তখন DAAAM 21 শতাংশ থেকে 53 শতাংশ বেশি নির্ভুল ছিল, প্রশ্নের ধরনের উপর নির্ভর করে।

ভবিষ্যতে, গবেষকরা DAAAM প্রসারিত করতে চান যাতে সিস্টেমটি পরিবেশে ঘটে যাওয়া উল্লেখযোগ্য ঘটনাগুলি ক্যাপচার করতে পারে। তারা সিস্টেমের প্রতিক্রিয়াগুলিতে আত্মবিশ্বাসের মাত্রা অন্তর্ভুক্ত করার জন্যও কাজ করে।

“অবশেষে, আমরা এমন রোবট রাখতে চাই যা যেকোনো ধরনের কাজে সাহায্য করতে পারে। এই কাঠামোর সাহায্যে, আমরা একটি সাধারণ এজেন্টকে সক্ষম করার জন্য ভিত্তি তৈরি করার চেষ্টা করছি যে আপনি যা কিছু জিজ্ঞাসা করতে পারেন তা করতে পারে,” বলেছেন গৌরলো।

এই গবেষণাটি আংশিকভাবে ইউএস আর্মি রিসার্চ ল্যাবরেটরি এবং অফিস অফ নেভাল রিসার্চ দ্বারা অর্থায়ন করা হয়েছিল। কার্লন বর্তমানে একজন অ্যামাজন স্কলার হিসেবে বিশ্রাম নিচ্ছেন; এই নিবন্ধটি এমআইটি-তে সম্পাদিত কাজ বর্ণনা করে এবং অ্যামাজনের সাথে অনুমোদিত নয়।



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *