ByteDance Astra প্রবর্তন করেছে: স্বায়ত্তশাসিত রোবট নেভিগেশনের জন্য একটি দ্বি-মডেল আর্কিটেকচার | সিঙ্ক্রোনাইজড

ByteDance Astra প্রবর্তন করেছে: স্বায়ত্তশাসিত রোবট নেভিগেশনের জন্য একটি দ্বি-মডেল আর্কিটেকচার | সিঙ্ক্রোনাইজড

নেপাল বনাম নামিবিয়া


শিল্প উৎপাদন থেকে দৈনন্দিন জীবনে বিভিন্ন সেক্টরে রোবটের ক্রমবর্ধমান একীকরণ উন্নত নেভিগেশন সিস্টেমের ক্রমবর্ধমান প্রয়োজনীয়তা তুলে ধরে। যাইহোক, সমসাময়িক রোবোটিক নেভিগেশন সিস্টেমগুলি বিভিন্ন এবং জটিল অভ্যন্তরীণ পরিবেশে উল্লেখযোগ্য চ্যালেঞ্জের মুখোমুখি হয়, যা ঐতিহ্যগত পদ্ধতির সীমাবদ্ধতা প্রকাশ করে। “আমি কোথায়?”, “আমি কোথায় যাচ্ছি?” এর মৌলিক প্রশ্নগুলিকে সম্বোধন করে। এবং “আমি সেখানে কিভাবে যাব?”, ByteDance Astra তৈরি করেছে, একটি উদ্ভাবনী দ্বৈত-মডেল আর্কিটেকচার যা এই ঐতিহ্যবাহী নেভিগেশন বাধাগুলি কাটিয়ে উঠতে এবং সাধারণ-উদ্দেশ্য মোবাইল রোবটগুলিকে সক্ষম করার জন্য ডিজাইন করা হয়েছে৷

প্রথাগত নেভিগেশন সিস্টেমগুলি সাধারণত লক্ষ্য স্থানীয়করণ, স্ব-স্থানীয়করণ এবং পথ পরিকল্পনার মূল চ্যালেঞ্জগুলি মোকাবেলার জন্য একাধিক, ছোট এবং প্রায়শই নিয়ম-ভিত্তিক মডিউল নিয়ে গঠিত। লক্ষ্য স্থানীয়করণ একটি মানচিত্রে একটি লক্ষ্য সনাক্ত করতে প্রাকৃতিক ভাষা বা চিত্র সংকেত বোঝা জড়িত। স্ব-স্থানীয়করণের জন্য একটি মানচিত্রের সঠিক অবস্থান নির্ধারণের জন্য একটি রোবট প্রয়োজন, বিশেষ করে গুদামঘরের মতো পুনরাবৃত্তিমূলক পরিবেশে চ্যালেঞ্জ যেখানে ঐতিহ্যগত পদ্ধতিগুলি প্রায়শই কৃত্রিম ল্যান্ডমার্কের উপর নির্ভর করে (যেমন, QR কোড)। পথ পরিকল্পনাকে আরও বিভক্ত করা হয়েছে একটি রুক্ষ পথ তৈরির জন্য বৈশ্বিক পরিকল্পনা এবং বাস্তব সময়ে বাধা এড়াতে এবং মধ্যবর্তী পয়েন্টে পৌঁছানোর জন্য স্থানীয় পরিকল্পনায়।

যদিও মৌলিক মডেলগুলি বিস্তৃত কাজগুলি মোকাবেলা করার জন্য ছোট মডেলগুলিকে একত্রিত করার প্রতিশ্রুতি দেখিয়েছে, সর্বোত্তম মডেলের সংখ্যা এবং ব্যাপক নেভিগেশনের জন্য তাদের কার্যকর সমন্বয় একটি উন্মুক্ত প্রশ্ন থেকে যায়।

ByteDance Astra প্রবর্তন করেছে: স্বায়ত্তশাসিত রোবট নেভিগেশনের জন্য একটি দ্বি-মডেল আর্কিটেকচার | সিঙ্ক্রোনাইজড

বাইটড্যান্সের অ্যাস্ট্রা, তাদের প্রবন্ধে “অস্ট্রা: হায়ারর্কিক্যাল মাল্টিমোডাল লার্নিং এর মাধ্যমে সাধারণ-উদ্দেশ্য মোবাইল রোবটস” (সাইট: https://astra-mobility.github.io/) এ বিস্তারিত রয়েছে, এই সীমাবদ্ধতাগুলিকে সমাধান করে৷ সিস্টেম 1/সিস্টেম 2 দৃষ্টান্ত অনুসারে, অ্যাস্ট্রার দুটি প্রধান উপ-মডেল রয়েছে: অ্যাস্ট্রা গ্লোবাল এবং আস্ট্রা লোকাল. Astra-Global গন্তব্য এবং স্ব-স্থানীয়করণের মতো কম-ফ্রিকোয়েন্সি কাজগুলি পরিচালনা করে, যখন Astra-স্থানীয় স্থানীয় রুট পরিকল্পনা এবং দূরত্ব অনুমানের মতো উচ্চ-ফ্রিকোয়েন্সি কাজগুলি পরিচালনা করে। এই স্থাপত্যটি রোবটগুলির জটিল অভ্যন্তরীণ স্থানগুলিতে নেভিগেট করার পদ্ধতিতে বিপ্লব করার প্রতিশ্রুতি দেয়।

অ্যাস্ট্রা-গ্লোবাল: বিশ্বব্যাপী স্থানীয়করণের জন্য স্মার্ট মস্তিষ্ক

অ্যাস্ট্রা-গ্লোবাল অ্যাস্ট্রা আর্কিটেকচারের স্মার্ট মূল হিসেবে কাজ করে, কম-ফ্রিকোয়েন্সির গুরুত্বপূর্ণ কাজগুলির জন্য দায়ী: স্ব-স্থানীয়করণ এবং লক্ষ্য স্থানীয়করণ। এটি একটি হিসাবে কাজ করে মাল্টিমডাল লার্জ ল্যাঙ্গুয়েজ মডেল (এমএলএলএম)একটি মানচিত্রের মধ্যে সঠিক বিশ্বব্যাপী অবস্থান অর্জন করতে ভিজ্যুয়াল এবং ভাষাগত ইনপুট প্রক্রিয়াকরণে পারদর্শী। এর ক্ষমতা শোষণের মধ্যে নিহিত একটি হাইব্রিড টপোলজিক্যাল-সিমেন্টিক গ্রাফ প্রাসঙ্গিক ইনপুট হিসাবে, মডেলটিকে ক্যোয়ারী ইমেজ বা টেক্সট প্রম্পটের উপর ভিত্তি করে সঠিকভাবে অবস্থানগুলি সনাক্ত করার অনুমতি দেয়।

এই শক্তিশালী স্থানীয়করণ সিস্টেম নির্মাণ শুরু হয় অফলাইন ম্যাপিং. গবেষণা দল একটি হাইব্রিড টপোলজিক্যাল-সিমেন্টিক গ্রাফ G=(V,E,L) তৈরির জন্য একটি অফলাইন পদ্ধতি তৈরি করেছে:

  • V (জাংশন): ভিডিও ইনপুট এবং আনুমানিক 6-ডিগ্রি-অফ-ফ্রিডম (DoF) SfM পোজ ডাউনস্যাম্পলিং দ্বারা প্রাপ্ত কীফ্রেমগুলি নোড এনকোডিং ক্যামেরা পোজ এবং ল্যান্ডমার্ক রেফারেন্স হিসাবে কাজ করে।
  • ই (প্রান্ত): অনির্দেশিত প্রান্তগুলি আপেক্ষিক নোড অবস্থানের উপর ভিত্তি করে সংযোগ তৈরি করে, যা বিশ্বব্যাপী পথ পরিকল্পনার জন্য অপরিহার্য।
  • L (ল্যান্ডমার্ক): শব্দার্থিক ওয়েপয়েন্ট তথ্য Astra-Global দ্বারা প্রতিটি সংযোগস্থলে ভিজ্যুয়াল ডেটা থেকে তৈরি করা হয়, যা মানচিত্রের শব্দার্থিক বোঝাপড়াকে সমৃদ্ধ করে। এই ল্যান্ডমার্কগুলি শব্দার্থিক বৈশিষ্ট্যগুলি সঞ্চয় করে এবং সহ-দৃশ্যমান সম্পর্কের মাধ্যমে একাধিক নোডের সাথে সংযুক্ত থাকে।

ব্যবহারিক স্থানীয়করণে, অ্যাস্ট্রা-গ্লোবালের স্ব-স্থানীয়করণ এবং গন্তব্য স্থানীয়করণের ক্ষমতার সুবিধা মোটা থেকে সূক্ষ্ম দুই ধাপ প্রক্রিয়া ভিজ্যুয়াল ভাষায় স্থানীয়করণের জন্য। মোটা পর্যায় ইনপুট ইমেজ এবং স্থানীয়করণ সংকেত বিশ্লেষণ করে, ল্যান্ডমার্ক সনাক্ত করে, একটি পূর্ব-নির্মিত ল্যান্ডমার্ক মানচিত্রের সাথে একটি চিঠিপত্র তৈরি করে এবং চাক্ষুষ সামঞ্জস্যের উপর ভিত্তি করে প্রার্থীদের ফিল্টার করে। তারপর, সূক্ষ্ম পদক্ষেপটি অফলাইন মানচিত্র থেকে রেফারেন্স ম্যাপ নোডের নমুনা করার জন্য ক্যোয়ারী ইমেজ এবং মোটা আউটপুট ব্যবহার করে এবং তাদের ভিজ্যুয়াল এবং অবস্থানের তথ্যের তুলনা করে সরাসরি ভবিষ্যদ্বাণী করা ভঙ্গিটি আউটপুট করতে।

জন্য একটি ভাষা-ভিত্তিক লক্ষ্যের স্থানীয়করণমডেলটি প্রাকৃতিক ভাষার নির্দেশাবলী ব্যাখ্যা করে, মানচিত্রের মধ্যে তাদের কার্যকরী বর্ণনা ব্যবহার করে প্রাসঙ্গিক ল্যান্ডমার্ক চিহ্নিত করে, এবং তারপর প্রাসঙ্গিক নোডগুলি সনাক্ত করতে, লক্ষ্য চিত্রগুলি পুনরুদ্ধার করতে এবং 6-DoF পোজগুলির জন্য ল্যান্ডমার্ক-টু-নোড অ্যাসোসিয়েশন মেকানিজম ব্যবহার করে।

শক্তিশালী স্থানীয়করণ ক্ষমতা সহ Astra-Global ক্ষমতায়নের জন্য, দলটি একটি কঠোর প্রশিক্ষণ পদ্ধতি ব্যবহার করেছে। মাধ্যমে Qwen2.5-VL মেরুদণ্ড হিসাবে, তারা একসঙ্গে মাপসই করা হয় তত্ত্বাবধানকৃত ফাইন টিউনিং (SFT) সঙ্গে গ্রুপ রিলেটিভ পলিসি অপ্টিমাইজেশান (GRPO). মোটা এবং সূক্ষ্ম স্থানীয়করণ, সহ-দৃশ্যমানতা সনাক্তকরণ, এবং ট্র্যাফিক প্রবণতা অনুমান সহ বিভিন্ন কাজের জন্য এসএফটি বিভিন্ন ডেটাসেট অন্তর্ভুক্ত করেছে। GRPO পর্বে, একটি নিয়ম-ভিত্তিক পুরষ্কার ফাংশন (ফরম্যাট, ল্যান্ডমার্ক এক্সট্রাকশন, ম্যাপ ম্যাচিং, এবং অতিরিক্ত ল্যান্ডমার্ক পুরষ্কার সহ) ভিজ্যুয়াল ল্যাঙ্গুয়েজ স্থানীয়করণ প্রশিক্ষণের জন্য ব্যবহার করা হয়। পরীক্ষায় দেখা গেছে যে GRPO Astra-Global-এর সাধারণীকরণে উল্লেখযোগ্যভাবে উন্নতি করেছে, শুধুমাত্র SFT পদ্ধতির চেয়ে অদেখা অভ্যন্তরীণ পরিবেশে 99.9% স্থানীয়করণ নির্ভুলতা অর্জন করেছে।

Astra-স্থানীয়: স্থানীয় পরিকল্পনার জন্য স্মার্ট সহকারী

Astra-Local Astra-এর উচ্চ-ফ্রিকোয়েন্সি টাস্ক স্মার্ট অ্যাসিস্ট্যান্ট হিসেবে কাজ করে, একটি মাল্টিটাস্কিং নেটওয়ার্ক যা দক্ষতার সাথে স্থানীয় রুট তৈরি করতে এবং সেন্সর ডেটা থেকে দূরত্ব অনুসন্ধানের সঠিকভাবে অনুমান করতে সক্ষম। এর স্থাপত্যে তিনটি মূল উপাদান রয়েছে: ক 4D স্প্যাটিওটেম্পোরাল এনকোডারপরিকল্পনা প্রধানএবং- দূরত্ব পরীক্ষার মাথা.

4D স্প্যাটিওটেম্পোরাল এনকোডার প্রথাগত মোবাইল স্ট্যাক উপলব্ধি এবং ভবিষ্যদ্বাণী মডিউল প্রতিস্থাপন করে। আসতে শুরু করে 3D স্থানিক এনকোডার যা ভিশন ট্রান্সফরমার (ViT) এবং Lift-Splat-Shoot ব্যবহার করে 2D চিত্র বৈশিষ্ট্যগুলিকে 3D ভক্সেল বৈশিষ্ট্যে রূপান্তর করার জন্য N সর্বমুখী চিত্রগুলিকে প্রক্রিয়া করে। এই 3D এনকোডারটি 3D ভলিউম্যাট্রিক নিউরাল রেন্ডারিং ব্যবহার করে স্ব-তত্ত্বাবধানে লার্নিং ব্যবহার করে প্রশিক্ষিত। 3D স্প্যাটিওটেম্পোরাল এনকোডার 3D এনকোডারে তৈরি করে, রেসনেট এবং ডিআইটি মডিউল ব্যবহার করে ভবিষ্যত ভক্সেল বৈশিষ্ট্যগুলি ভবিষ্যদ্বাণী করতে ইনপুট হিসাবে অতীতের ভক্সেল বৈশিষ্ট্য এবং ভবিষ্যতের টাইমস্ট্যাম্প গ্রহণ করে এবং দূরত্ব পরিকল্পনা এবং পরীক্ষার জন্য বর্তমান এবং ভবিষ্যতের পরিবেশগত উপস্থাপনা প্রদান করে।

পরিকল্পনা প্রধানপ্রাক-প্রশিক্ষিত 4D বৈশিষ্ট্য, রোবট গতি এবং কাজের তথ্যের উপর ভিত্তি করে, ব্যবহার করে অপারেটিং ট্র্যাজেক্টোরি তৈরি করে ট্রান্সফরমার ভিত্তিক ফ্লাক্স ম্যাচিং. দ্বন্দ্ব প্রতিরোধ করার জন্য, পরিকল্পনা প্রধান ক ছদ্মবেশে ESDF এর ক্ষতি (ইউক্লিডীয় স্বাক্ষরিত দূরত্ব ক্ষেত্র)। এই ক্ষতি একটি 3D অকুপেন্সি ম্যাপের ESDF গণনা করে এবং একটি 2D গ্রাউন্ড ট্রুথ ট্রাজেক্টোরি মাস্ক প্রয়োগ করে, উল্লেখযোগ্যভাবে সংঘর্ষের হার কমিয়ে দেয়। পরীক্ষাগুলি অন্যান্য পদ্ধতির তুলনায় একটি আউট-অফ-ডিস্ট্রিবিউশন (OOD) ডেটাসেটে সংঘর্ষের হার এবং সামগ্রিক স্কোরে এর উচ্চতর কর্মক্ষমতা প্রদর্শন করে।

দূরত্ব পরীক্ষার মাথা বর্তমান এবং পূর্ববর্তী 4D বৈশিষ্ট্য এবং অতিরিক্ত সেন্সর ডেটা (যেমন, IMU, চাকা ডেটা) ব্যবহার করে রোবটের আপেক্ষিক ভঙ্গির পূর্বাভাস দেয়। এটি বিভিন্ন সেন্সর থেকে তথ্য একত্রিত করার জন্য একটি ট্রান্সফরমার মডেলকে প্রশিক্ষণ দেয়। প্রতিটি সেন্সর মোড একটি নির্দিষ্ট টোকেন দ্বারা প্রক্রিয়া করা হয়, মোডাল রিং এবং টেম্পোরাল পজিশন রিংগুলির সাথে মিলিত হয়, একটি ট্রান্সফরমার এনকোডারে খাওয়ানো হয় এবং শেষ পর্যন্ত আপেক্ষিক ভঙ্গির পূর্বাভাস দিতে CLS টোকেন ব্যবহার করে। পরীক্ষাগুলি মাল্টি-সেন্সর ফিউশন এবং ভঙ্গি অনুমানে অডিওমেট্রি হেডের চমৎকার কর্মক্ষমতা দেখিয়েছে, উল্লেখযোগ্যভাবে ঘূর্ণন নির্ভুলতা উন্নত করে এবং সামগ্রিক ট্র্যাজেক্টরি ত্রুটি হ্রাস করে।


পরীক্ষামূলক বৈধতা

Astra এর কর্মক্ষমতা ব্যাপকভাবে মূল্যায়ন করার জন্য বিভিন্ন গৃহমধ্যস্থ পরিবেশে (গুদাম, অফিস, বাড়ি) ব্যাপক পরীক্ষা চালানো হয়েছিল।

Astra-Global-এর মাল্টিমোডাল স্থানীয়করণ ক্ষমতা বিভিন্ন পরীক্ষা-নিরীক্ষার মাধ্যমে যাচাই করা হয়েছে, টেক্সট এবং ইমেজ লোকালাইজেশন প্রশ্নগুলি পরিচালনা করার ক্ষেত্রে উচ্চতর কর্মক্ষমতা প্রদর্শন করে। লক্ষ্য স্থানীয়করণের জন্য, এটি সঠিকভাবে টেক্সট কমান্ডের উপর ভিত্তি করে মিলিত ছবি এবং ভঙ্গি সনাক্ত করে (যেমন, “বিশ্রামের এলাকা খুঁজুন”)। প্রথাগত ভিজ্যুয়াল প্লেস রিকগনিশন (ভিপিআর) পদ্ধতির তুলনায়, অ্যাস্ট্রা-গ্লোবাল উল্লেখযোগ্য সুবিধাগুলি উপস্থাপন করে:

  • বিস্তারিত ক্যাপচার করুন: বৈশ্বিক বৈশিষ্ট্যের উপর VPR-এর নির্ভরতার বিপরীতে, Astra-Global সঠিকভাবে সূক্ষ্ম বিবরণ ক্যাপচার করে যেমন রুম নম্বর, অনুরূপ দৃশ্যে স্থানীয়করণ ত্রুটি প্রতিরোধ করে।
  • স্থিতিশীলতার দৃষ্টিকোণ: শব্দার্থিক ল্যান্ডমার্কের উপর ভিত্তি করে, Astra-Global ক্যামেরার কোণে বড় পরিবর্তনের সাথেও স্থিতিশীল স্থানীয়করণ বজায় রাখে, যেখানে VPR পদ্ধতি সাধারণত ব্যর্থ হয়।
  • অবস্থান নির্ভুলতা: Astra-Global সবচেয়ে উপযুক্ত পোজ নির্বাচন করতে স্থানিক সম্পর্কের অগ্রগতি লাভ করে, যা ঐতিহ্যবাহী VPR-এর তুলনায় উল্লেখযোগ্যভাবে উচ্চতর পোজ নির্ভুলতা (1 মিটারের মধ্যে, 1 মিটার ত্রুটি দূরত্ব এবং 5 ডিগ্রী কোণ ত্রুটি) প্রদর্শন করে, গুদাম পরিবেশে 30% এর বেশি উন্নতির সাথে।

Astra-স্থানীয় নকশা মাথা এবং odometry পুঙ্খানুপুঙ্খভাবে পরীক্ষা করা হয়েছে. ডিজাইন হেড, ট্রান্সফরমার-ভিত্তিক ফ্লো ম্যাচিং এবং মুখোশযুক্ত ESDF ক্ষতি ব্যবহার করে, সংঘর্ষের হার, গতি, এবং OOD ডেটাসেটে সামগ্রিক স্কোরের ক্ষেত্রে ACT এবং নীতির বিস্তারের মতো পারফরম্যান্স পদ্ধতি। এটি সংঘর্ষের ঝুঁকি কমাতে ছদ্মবেশী ESDF-এর ক্ষতির কার্যকারিতা তুলে ধরে।

সিঙ্ক্রোনাইজড ইমেজ সিকোয়েন্স, আইএমইউ, হুইল ডেটা এবং ট্রু পোজ সহ মাল্টিমোডাল ডেটাসেটে ওডোমেট্রি হেডের কর্মক্ষমতা মূল্যায়ন করা হয়েছিল। দুই-ফ্রেম BEV-ODOM বেসলাইনের তুলনায়, Astra-স্থানীয় অডিওমেট্রি হেড মাল্টি-সেন্সর ফিউশন এবং পোজ অনুমানে উল্লেখযোগ্য সুবিধা দেখিয়েছে। IMU ডেটা অন্তর্ভুক্ত করা নাটকীয়ভাবে রোল অনুমানের নির্ভুলতা উন্নত করেছে, সামগ্রিক ট্র্যাজেক্টরি ত্রুটি প্রায় 2% কমিয়েছে। চাকা ডেটার অতিরিক্ত অন্তর্ভুক্তি স্কেলের স্থায়িত্ব এবং অনুমানের নির্ভুলতা উন্নত করেছে এবং এর উচ্চতর মাল্টি-সেন্সর ডেটা ফিউশন ক্ষমতা যাচাই করেছে।

Astra ভবিষ্যতের উন্নয়ন এবং অ্যাপ্লিকেশনের জন্য উল্লেখযোগ্য প্রতিশ্রুতি রাখে। এটির স্থাপনা আরও জটিল অভ্যন্তরীণ পরিবেশ যেমন বড় শপিং মল, হাসপাতাল এবং লাইব্রেরিতে প্রসারিত করা যেতে পারে, যেখানে এটি সঠিক পণ্য স্থাপন, দক্ষ চিকিৎসা সরবরাহ সরবরাহ এবং বই সংস্থার মতো কাজগুলিতে সহায়তা করতে পারে।

যাইহোক, উন্নতির জন্য ক্ষেত্র আছে. Astra-Global-এর জন্য, বর্তমান মানচিত্রের উপস্থাপনা তথ্যের ক্ষতি এবং টোকেন দৈর্ঘ্যের ভারসাম্য বজায় রাখলেও, তাদের মাঝে মাঝে সমালোচনামূলক শব্দার্থগত বিবরণের অভাব হতে পারে। ভবিষ্যত কাজ শব্দার্থগত তথ্যের সর্বোচ্চ সংরক্ষণের সময় দক্ষতা অপ্টিমাইজ করার জন্য বিকল্প মানচিত্র সংকোচন পদ্ধতিতে ফোকাস করবে। উপরন্তু, বর্তমান একক-ফ্রেম স্থানীয়করণ বৈশিষ্ট্য-দরিদ্র বা অত্যন্ত পুনরাবৃত্তিমূলক পরিবেশে ব্যর্থ হতে পারে; ভবিষ্যত পরিকল্পনার মধ্যে রয়েছে সক্রিয় তদন্ত প্রক্রিয়া এবং শক্তিশালী স্থানীয়করণের জন্য সাময়িক যুক্তি।

অ্যাস্ট্রা-লোকালের জন্য, আউট-অফ-ডিস্ট্রিবিউশন (OOD) পরিস্থিতিতে দৃঢ়তা উন্নত করা অপরিহার্য, উন্নত মডেল আর্কিটেকচার এবং প্রশিক্ষণ পদ্ধতির প্রয়োজন। সিস্টেমের স্থিতিশীলতা উন্নত করার জন্য কঠোর সংহতকরণ এবং বিরামবিহীন স্যুইচিংয়ের জন্য প্রতিক্রিয়া সিস্টেমের একটি পুনঃডিজাইনও পরিকল্পনা করা হয়েছে। তদ্ব্যতীত, নির্দেশনা-অনুসরণীয় ক্ষমতাগুলিকে অন্তর্ভুক্ত করা রোবটকে প্রাকৃতিক ভাষার আদেশগুলি বুঝতে এবং কার্যকর করতে, গতিশীল, মানব-কেন্দ্রিক পরিবেশে তাদের উপযোগিতা প্রসারিত করতে এবং আরও প্রাকৃতিক মানব-রোবট মিথস্ক্রিয়াকে উত্সাহিত করবে।



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *