জেনারেটিভ এআই একটি ওয়্যারলেস ভিশন সিস্টেমকে উন্নত করে যা বাধাগুলির মধ্য দিয়ে দেখে

জেনারেটিভ এআই একটি ওয়্যারলেস ভিশন সিস্টেমকে উন্নত করে যা বাধাগুলির মধ্য দিয়ে দেখে

নেপাল বনাম নামিবিয়া



জেনারেটিভ এআই একটি ওয়্যারলেস ভিশন সিস্টেমকে উন্নত করে যা বাধাগুলির মধ্য দিয়ে দেখে

এমআইটি গবেষকরা এক দশকেরও বেশি সময় ধরে এমন কৌশল অধ্যয়ন করেছেন যা রোবটগুলিকে বাধাগুলির মধ্য দিয়ে “দেখতে” লুকানো বস্তুগুলি খুঁজে পেতে এবং পরিচালনা করতে দেয়। তাদের পদ্ধতিগুলি পৃষ্ঠ-অনুপ্রবেশকারী বেতার সংকেতগুলিকে ব্যবহার করে যা লুকানো আইটেমগুলিকে প্রতিফলিত করে।

এখন, গবেষকরা একটি দীর্ঘস্থায়ী বাধা কাটিয়ে উঠতে জেনারেটিভ কৃত্রিম বুদ্ধিমত্তার মডেলগুলি ব্যবহার করছেন যা পূর্ববর্তী পদ্ধতির নির্ভুলতাকে সীমিত করেছে। ফলাফলটি হল একটি নতুন পদ্ধতি যা আরও সঠিক আকৃতির পুনর্গঠন তৈরি করে, যা একটি রোবটের দৃষ্টিভঙ্গি থেকে অবরুদ্ধ বস্তুগুলিকে নির্ভরযোগ্যভাবে ধরতে এবং ম্যানিপুলেট করার ক্ষমতা উন্নত করতে পারে।

এই নতুন কৌশলটি প্রতিফলিত ওয়্যারলেস সিগন্যাল থেকে একটি লুকানো বস্তুর আংশিক পুনর্গঠন তৈরি করে এবং একটি বিশেষভাবে তৈরি করা এআই মডেল ব্যবহার করে এর আকৃতির অনুপস্থিত অংশগুলি পূরণ করে।

গবেষকরা একটি বর্ধিত সিস্টেমও উপস্থাপন করেছেন যা সমস্ত আসবাবপত্র সহ একটি সম্পূর্ণ রুম সঠিকভাবে পুনরায় তৈরি করতে জেনারেটিভ কৃত্রিম বুদ্ধিমত্তা ব্যবহার করে। সিস্টেমটি একটি স্থির রাডার থেকে প্রেরিত ওয়্যারলেস সংকেত ব্যবহার করে, যা মহাকাশে চলমান মানুষের প্রতিফলন করে।

এটি অনেকগুলি বিদ্যমান পদ্ধতির মধ্যে একটি বড় চ্যালেঞ্জ অতিক্রম করে, যার জন্য পরিবেশ স্ক্যান করার জন্য একটি মোবাইল রোবটে একটি বেতার সেন্সর ইনস্টল করা প্রয়োজন। এবং কিছু জনপ্রিয় ক্যামেরা-ভিত্তিক কৌশলের বিপরীতে, তাদের পদ্ধতিটি আশেপাশের লোকেদের গোপনীয়তা রক্ষা করে।

এই উদ্ভাবনগুলি গুদামগুলিতে রোবটগুলিকে শিপিংয়ের আগে প্যাকেজ করা আইটেমগুলি যাচাই করার অনুমতি দিতে পারে, পণ্যের রিটার্ন থেকে বর্জ্য দূর করে। তারা স্মার্ট হোম রোবটগুলিকে একটি রুমে কারও অবস্থান বুঝতে সক্ষম করতে পারে, মানব-রোবট মিথস্ক্রিয়ার সুরক্ষা এবং দক্ষতা উন্নত করে।

“আমরা এখন যা করেছি তা হল কৃত্রিম বুদ্ধিমত্তার মডেলগুলি তৈরি করা যা আমাদের ওয়্যারলেস প্রতিফলনগুলি বুঝতে সাহায্য করে। এটি অনেক নতুন এবং আকর্ষণীয় অ্যাপ্লিকেশন খুলে দেয়, কিন্তু প্রযুক্তিগত দৃষ্টিকোণ থেকে এটি ক্ষমতার একটি গুণগত উল্লম্ফন, যা আমরা আগে দেখতে পাইনি এমন শূন্যস্থান পূরণ করার ক্ষমতা থেকে শুরু করে প্রতিফলন ব্যাখ্যা করার ক্ষমতা এবং সম্পূর্ণ ইঞ্জিনের ইঞ্জিনের প্রধান বৈদ্যুতিক দৃশ্যের পুনর্গঠন এবং ফ্যাডেল বিজ্ঞান বলে।” এমআইটিতে কম্পিউটার ইঞ্জিনিয়ারিং বিভাগের গ্রুপ। ল্যাব, এবং এই কৌশলগুলির উপর দুটি নিবন্ধের সিনিয়র লেখক। “আমরা অবশেষে বেতার দৃষ্টি আনলক করতে কৃত্রিম বুদ্ধিমত্তা ব্যবহার করছি।”

প্রধান লেখক এবং গবেষণা সহকারী লরা ডডসের প্রথম নিবন্ধে লাডিভ যোগ দিয়েছেন; পাশাপাশি গবেষণা সহকারী মাইসি লাম, ওয়ালিদ আকবর ওয়েইবো চেং; এবং প্রধান লেখক এবং প্রাক্তন পোস্টডক কাইচেন ঝু দ্বারা দ্বিতীয় কাগজে; ডডস; এবং গবেষণা সহকারী সৈয়দ সাদ আফজাল। উভয় গবেষণাপত্রই কম্পিউটার ভিশন এবং প্যাটার্ন রিকগনিশনের উপর IEEE সম্মেলনে উপস্থাপন করা হবে।

ক্রমবর্ধমান বিশেষত্ব

আদিব গ্রুপ পূর্বে মিলিমিটার তরঙ্গ (mmWave) সংকেত ব্যবহার করে দেখায় লুকানো 3D বস্তুর সঠিক পুনর্গঠন তৈরি করতে, যেমন একটি স্তূপের নিচে চাপা পড়ে থাকা হারিয়ে যাওয়া মানিব্যাগ।

এই তরঙ্গগুলি, যা ওয়াই-ফাইতে ব্যবহৃত একই ধরণের সংকেত, ড্রাইওয়াল, প্লাস্টিক এবং কার্ডবোর্ডের মতো সাধারণ বাধাগুলি অতিক্রম করতে পারে এবং লুকানো বস্তুগুলিকে বাউন্স করতে পারে৷

কিন্তু mmWave সাধারণত স্পেকুলারলি প্রতিফলিত হয়, মানে একটি তরঙ্গ কোনো পৃষ্ঠে আঘাত করার পর এক দিকে প্রতিফলিত হয়। তাই পৃষ্ঠের বড় অংশগুলি মিমি ওয়েভ সেন্সর থেকে দূরে থাকা সংকেতগুলিকে প্রতিফলিত করবে, এই অঞ্চলগুলিকে কার্যকরভাবে অদৃশ্য করে তুলবে।

“যখন আমরা একটি বস্তুর পুনর্গঠন করতে চাই, তখন আমরা কেবল উপরের পৃষ্ঠটি দেখতে পারি এবং আমরা নীচের বা পাশের কোনটি দেখতে পারি না,” ডডস ব্যাখ্যা করেন।

গবেষকরা পূর্বে প্রতিফলিত সংকেত ব্যাখ্যা করতে পদার্থবিজ্ঞানের নীতিগুলি ব্যবহার করেছেন, তবে এটি পুনর্গঠিত 3D আকারের যথার্থতা সীমাবদ্ধ করে।

নতুন কাগজপত্রে, তারা একটি আংশিক পুনর্গঠনে অনুপস্থিত অংশগুলি পূরণ করতে একটি জেনারেটিভ এআই মডেল ব্যবহার করে এই সীমাবদ্ধতা অতিক্রম করেছে।

“কিন্তু তারপরে চ্যালেঞ্জ হয়ে যায়: এই ফাঁকগুলি পূরণ করার জন্য আপনি কীভাবে এই মডেলগুলিকে প্রশিক্ষণ দেবেন?” দয়া করে বলেন।

সাধারণত, গবেষকরা একটি AI মডেলকে প্রশিক্ষণ দেওয়ার জন্য অত্যন্ত বড় ডেটাসেট ব্যবহার করেন, যা ক্লদ ভেল্মার মতো মডেলগুলি এত চিত্তাকর্ষকভাবে সম্পাদন করার একটি কারণ। কিন্তু প্রশিক্ষণের জন্য যথেষ্ট বড় কোনো mmWave ডেটাসেট নেই।

পরিবর্তে, গবেষকরা এমএমওয়েভ প্রতিফলনের বৈশিষ্ট্যগুলি অনুকরণ করতে বড় কম্পিউটার ভিশন ডেটাসেটে চিত্রগুলিকে মেলে।

“স্পেকুলারিটি বৈশিষ্ট্য এবং এই প্রতিফলন থেকে আমরা যে আওয়াজ পাই তা কল্পনা করুন যাতে আমরা আমাদের ক্ষেত্রে বিদ্যমান ডেটাসেটগুলি প্রয়োগ করতে পারি। এটি করার জন্য পর্যাপ্ত নতুন ডেটা সংগ্রহ করতে আমাদের কয়েক বছর লেগে যেত,” ল্যাম বলেছেন।

গবেষকরা এই লাগানো ডেটাতে সরাসরি mmWave প্রতিফলনের পদার্থবিদ্যাকে এম্বেড করেন, একটি সিন্থেটিক ডেটাসেট তৈরি করেন যা তারা একটি জেনারেটিভ এআই মডেল শেখানোর জন্য ব্যবহার করে প্রশংসনীয় আকৃতির পুনর্গঠন করতে।

সম্পূর্ণ সিস্টেম, যাকে ওয়েভ-ফর্মার বলা হয়, mmWave প্রতিফলনের উপর ভিত্তি করে সম্ভাব্য বস্তুর উপরিভাগের একটি সেটের পরামর্শ দেয়, আকৃতিটি সম্পূর্ণ করার জন্য তাদেরকে জেনারেটিভ এআই মডেলে ফিড করে, তারপর একটি সম্পূর্ণ পুনর্গঠন না হওয়া পর্যন্ত পৃষ্ঠগুলিকে পরিমার্জিত করে।

ওয়েভ-ফর্মার প্রায় 70টি দৈনন্দিন বস্তুর বিশ্বস্ত পুনর্গঠন তৈরি করতে সক্ষম হয়েছিল, যেমন ক্যান, বাক্স, বাসনপত্র এবং ফল, অত্যাধুনিক বেসলাইনের তুলনায় প্রায় 20 শতাংশ নির্ভুলতা বৃদ্ধি করেছে। বস্তুগুলি পিচবোর্ড, কাঠ, ড্রাইওয়াল, প্লাস্টিক এবং ফ্যাব্রিকের পিছনে বা নীচে লুকানো ছিল।

“ভূত” দেখুন

দলটি একটি বর্ধিত সিস্টেম তৈরি করতে একই পদ্ধতি ব্যবহার করেছে যা ঘরের চারপাশে চলাফেরা করা মানুষের কাছ থেকে mmWave প্রতিফলনগুলিকে ব্যবহার করে সম্পূর্ণ অন্দর দৃশ্যগুলিকে সম্পূর্ণরূপে পুনরায় তৈরি করে।

মানব আন্দোলন বহু-পাথের প্রতিচ্ছবি তৈরি করে। বেশ কিছু মিমি তরঙ্গ ব্যক্তি থেকে প্রতিফলিত হয়, তারপর আবার একটি প্রাচীর বা বস্তু থেকে প্রতিফলিত হয় এবং তারপর সেন্সরে ফিরে আসে, ডডস ব্যাখ্যা করেন।

এই গৌণ প্রতিফলনগুলি তথাকথিত “ভূত সংকেত” তৈরি করে, যা আসল সংকেতের প্রতিফলিত অনুলিপি যা একজন ব্যক্তির চলাফেরার সাথে সাথে অবস্থান পরিবর্তন করে। এই ভূত সংকেত সাধারণত গোলমাল হিসাবে বরখাস্ত করা হয়, কিন্তু তারা রুম বিন্যাস সম্পর্কে তথ্য ধারণ করে.

“সময়ের সাথে এই প্রতিফলনগুলি কীভাবে পরিবর্তিত হয় তা বিশ্লেষণ করে, আমরা আমাদের চারপাশের পরিবেশ সম্পর্কে একটি মোটামুটি ধারণা পেতে শুরু করতে পারি। তবে এই সংকেতগুলিকে সরাসরি ব্যাখ্যা করার চেষ্টা করা সঠিকতা এবং রেজোলিউশনে সীমাবদ্ধ থাকবে।” ডডস বলেছেন।

দৃশ্যের রুক্ষ পুনর্গঠন ব্যাখ্যা করতে এবং মাল্টিপাথ mmWave প্রতিফলনের আচরণ বোঝার জন্য তারা একটি জেনারেটিভ কৃত্রিম বুদ্ধিমত্তা মডেল শেখানোর জন্য অনুরূপ প্রশিক্ষণ পদ্ধতি ব্যবহার করেছিল। এই মডেলটি শূন্যস্থান পূরণ করে, দৃশ্যটি সম্পূর্ণ না হওয়া পর্যন্ত প্রাথমিক পুনর্গঠনকে পরিমার্জন করে।

তারা একটি একক মিমি ওয়েভ রাডার দ্বারা বন্দী 100 টিরও বেশি মানব ট্র্যাজেক্টোরি ব্যবহার করে RISE নামক তাদের দৃশ্য পুনর্গঠন ব্যবস্থা পরীক্ষা করেছে। গড়ে, RISE পুনর্গঠন তৈরি করেছে যা বিদ্যমান কৌশলগুলির তুলনায় প্রায় দ্বিগুণ সঠিক ছিল।

ভবিষ্যতে, গবেষকরা তাদের পুনর্গঠনে বিস্তারিত এবং বিস্তারিত উন্নতি করতে চান। তারা ওয়্যারলেস সিগন্যালের জন্য বড় ফাউন্ডেশনাল মডেল তৈরি করতে চায়, যেমন GPT, ক্লড, এবং জেমিনি ফাউন্ডেশনাল মডেল ভাষা এবং দৃষ্টিভঙ্গির জন্য, যা নতুন অ্যাপ্লিকেশন খুলতে পারে।

এই কাজটি আংশিকভাবে ন্যাশনাল সায়েন্স ফাউন্ডেশন (NSF), MIT মিডিয়া ল্যাব এবং আমাজন দ্বারা সমর্থিত।



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *