শিল্প উৎপাদন থেকে দৈনন্দিন জীবনে বিভিন্ন সেক্টরে রোবটের ক্রমবর্ধমান একীকরণ উন্নত নেভিগেশন সিস্টেমের ক্রমবর্ধমান প্রয়োজনীয়তা তুলে ধরে। যাইহোক, সমসাময়িক রোবোটিক নেভিগেশন সিস্টেমগুলি বিভিন্ন এবং জটিল অভ্যন্তরীণ পরিবেশে উল্লেখযোগ্য চ্যালেঞ্জের মুখোমুখি হয়, যা ঐতিহ্যগত পদ্ধতির সীমাবদ্ধতা প্রকাশ করে। “আমি কোথায়?”, “আমি কোথায় যাচ্ছি?” এর মৌলিক প্রশ্নগুলিকে সম্বোধন করে। এবং “আমি সেখানে কিভাবে যাব?”, ByteDance Astra তৈরি করেছে, একটি উদ্ভাবনী দ্বৈত-মডেল আর্কিটেকচার যা এই ঐতিহ্যবাহী নেভিগেশন বাধাগুলি কাটিয়ে উঠতে এবং সাধারণ-উদ্দেশ্য মোবাইল রোবটগুলিকে সক্ষম করার জন্য ডিজাইন করা হয়েছে৷
প্রথাগত নেভিগেশন সিস্টেমগুলি সাধারণত লক্ষ্য স্থানীয়করণ, স্ব-স্থানীয়করণ এবং পথ পরিকল্পনার মূল চ্যালেঞ্জগুলি মোকাবেলার জন্য একাধিক, ছোট এবং প্রায়শই নিয়ম-ভিত্তিক মডিউল নিয়ে গঠিত। লক্ষ্য স্থানীয়করণ একটি মানচিত্রে একটি লক্ষ্য সনাক্ত করতে প্রাকৃতিক ভাষা বা চিত্র সংকেত বোঝা জড়িত। স্ব-স্থানীয়করণের জন্য একটি মানচিত্রের সঠিক অবস্থান নির্ধারণের জন্য একটি রোবট প্রয়োজন, বিশেষ করে গুদামঘরের মতো পুনরাবৃত্তিমূলক পরিবেশে চ্যালেঞ্জ যেখানে ঐতিহ্যগত পদ্ধতিগুলি প্রায়শই কৃত্রিম ল্যান্ডমার্কের উপর নির্ভর করে (যেমন, QR কোড)। পথ পরিকল্পনাকে আরও বিভক্ত করা হয়েছে একটি রুক্ষ পথ তৈরির জন্য বৈশ্বিক পরিকল্পনা এবং বাস্তব সময়ে বাধা এড়াতে এবং মধ্যবর্তী পয়েন্টে পৌঁছানোর জন্য স্থানীয় পরিকল্পনায়।
যদিও মৌলিক মডেলগুলি বিস্তৃত কাজগুলি মোকাবেলা করার জন্য ছোট মডেলগুলিকে একত্রিত করার প্রতিশ্রুতি দেখিয়েছে, সর্বোত্তম মডেলের সংখ্যা এবং ব্যাপক নেভিগেশনের জন্য তাদের কার্যকর সমন্বয় একটি উন্মুক্ত প্রশ্ন থেকে যায়।

বাইটড্যান্সের অ্যাস্ট্রা, তাদের প্রবন্ধে “অস্ট্রা: হায়ারর্কিক্যাল মাল্টিমোডাল লার্নিং এর মাধ্যমে সাধারণ-উদ্দেশ্য মোবাইল রোবটস” (সাইট: https://astra-mobility.github.io/) এ বিস্তারিত রয়েছে, এই সীমাবদ্ধতাগুলিকে সমাধান করে৷ সিস্টেম 1/সিস্টেম 2 দৃষ্টান্ত অনুসারে, অ্যাস্ট্রার দুটি প্রধান উপ-মডেল রয়েছে: অ্যাস্ট্রা গ্লোবাল এবং আস্ট্রা লোকাল. Astra-Global গন্তব্য এবং স্ব-স্থানীয়করণের মতো কম-ফ্রিকোয়েন্সি কাজগুলি পরিচালনা করে, যখন Astra-স্থানীয় স্থানীয় রুট পরিকল্পনা এবং দূরত্ব অনুমানের মতো উচ্চ-ফ্রিকোয়েন্সি কাজগুলি পরিচালনা করে। এই স্থাপত্যটি রোবটগুলির জটিল অভ্যন্তরীণ স্থানগুলিতে নেভিগেট করার পদ্ধতিতে বিপ্লব করার প্রতিশ্রুতি দেয়।

অ্যাস্ট্রা-গ্লোবাল: বিশ্বব্যাপী স্থানীয়করণের জন্য স্মার্ট মস্তিষ্ক
অ্যাস্ট্রা-গ্লোবাল অ্যাস্ট্রা আর্কিটেকচারের স্মার্ট মূল হিসেবে কাজ করে, কম-ফ্রিকোয়েন্সির গুরুত্বপূর্ণ কাজগুলির জন্য দায়ী: স্ব-স্থানীয়করণ এবং লক্ষ্য স্থানীয়করণ। এটি একটি হিসাবে কাজ করে মাল্টিমডাল লার্জ ল্যাঙ্গুয়েজ মডেল (এমএলএলএম)একটি মানচিত্রের মধ্যে সঠিক বিশ্বব্যাপী অবস্থান অর্জন করতে ভিজ্যুয়াল এবং ভাষাগত ইনপুট প্রক্রিয়াকরণে পারদর্শী। এর ক্ষমতা শোষণের মধ্যে নিহিত একটি হাইব্রিড টপোলজিক্যাল-সিমেন্টিক গ্রাফ প্রাসঙ্গিক ইনপুট হিসাবে, মডেলটিকে ক্যোয়ারী ইমেজ বা টেক্সট প্রম্পটের উপর ভিত্তি করে সঠিকভাবে অবস্থানগুলি সনাক্ত করার অনুমতি দেয়।
এই শক্তিশালী স্থানীয়করণ সিস্টেম নির্মাণ শুরু হয় অফলাইন ম্যাপিং. গবেষণা দল একটি হাইব্রিড টপোলজিক্যাল-সিমেন্টিক গ্রাফ G=(V,E,L) তৈরির জন্য একটি অফলাইন পদ্ধতি তৈরি করেছে:
- V (জাংশন): ভিডিও ইনপুট এবং আনুমানিক 6-ডিগ্রি-অফ-ফ্রিডম (DoF) SfM পোজ ডাউনস্যাম্পলিং দ্বারা প্রাপ্ত কীফ্রেমগুলি নোড এনকোডিং ক্যামেরা পোজ এবং ল্যান্ডমার্ক রেফারেন্স হিসাবে কাজ করে।
- ই (প্রান্ত): অনির্দেশিত প্রান্তগুলি আপেক্ষিক নোড অবস্থানের উপর ভিত্তি করে সংযোগ তৈরি করে, যা বিশ্বব্যাপী পথ পরিকল্পনার জন্য অপরিহার্য।
- L (ল্যান্ডমার্ক): শব্দার্থিক ওয়েপয়েন্ট তথ্য Astra-Global দ্বারা প্রতিটি সংযোগস্থলে ভিজ্যুয়াল ডেটা থেকে তৈরি করা হয়, যা মানচিত্রের শব্দার্থিক বোঝাপড়াকে সমৃদ্ধ করে। এই ল্যান্ডমার্কগুলি শব্দার্থিক বৈশিষ্ট্যগুলি সঞ্চয় করে এবং সহ-দৃশ্যমান সম্পর্কের মাধ্যমে একাধিক নোডের সাথে সংযুক্ত থাকে।
ব্যবহারিক স্থানীয়করণে, অ্যাস্ট্রা-গ্লোবালের স্ব-স্থানীয়করণ এবং গন্তব্য স্থানীয়করণের ক্ষমতার সুবিধা মোটা থেকে সূক্ষ্ম দুই ধাপ প্রক্রিয়া ভিজ্যুয়াল ভাষায় স্থানীয়করণের জন্য। মোটা পর্যায় ইনপুট ইমেজ এবং স্থানীয়করণ সংকেত বিশ্লেষণ করে, ল্যান্ডমার্ক সনাক্ত করে, একটি পূর্ব-নির্মিত ল্যান্ডমার্ক মানচিত্রের সাথে একটি চিঠিপত্র তৈরি করে এবং চাক্ষুষ সামঞ্জস্যের উপর ভিত্তি করে প্রার্থীদের ফিল্টার করে। তারপর, সূক্ষ্ম পদক্ষেপটি অফলাইন মানচিত্র থেকে রেফারেন্স ম্যাপ নোডের নমুনা করার জন্য ক্যোয়ারী ইমেজ এবং মোটা আউটপুট ব্যবহার করে এবং তাদের ভিজ্যুয়াল এবং অবস্থানের তথ্যের তুলনা করে সরাসরি ভবিষ্যদ্বাণী করা ভঙ্গিটি আউটপুট করতে।

জন্য একটি ভাষা-ভিত্তিক লক্ষ্যের স্থানীয়করণমডেলটি প্রাকৃতিক ভাষার নির্দেশাবলী ব্যাখ্যা করে, মানচিত্রের মধ্যে তাদের কার্যকরী বর্ণনা ব্যবহার করে প্রাসঙ্গিক ল্যান্ডমার্ক চিহ্নিত করে, এবং তারপর প্রাসঙ্গিক নোডগুলি সনাক্ত করতে, লক্ষ্য চিত্রগুলি পুনরুদ্ধার করতে এবং 6-DoF পোজগুলির জন্য ল্যান্ডমার্ক-টু-নোড অ্যাসোসিয়েশন মেকানিজম ব্যবহার করে।
শক্তিশালী স্থানীয়করণ ক্ষমতা সহ Astra-Global ক্ষমতায়নের জন্য, দলটি একটি কঠোর প্রশিক্ষণ পদ্ধতি ব্যবহার করেছে। মাধ্যমে Qwen2.5-VL মেরুদণ্ড হিসাবে, তারা একসঙ্গে মাপসই করা হয় তত্ত্বাবধানকৃত ফাইন টিউনিং (SFT) সঙ্গে গ্রুপ রিলেটিভ পলিসি অপ্টিমাইজেশান (GRPO). মোটা এবং সূক্ষ্ম স্থানীয়করণ, সহ-দৃশ্যমানতা সনাক্তকরণ, এবং ট্র্যাফিক প্রবণতা অনুমান সহ বিভিন্ন কাজের জন্য এসএফটি বিভিন্ন ডেটাসেট অন্তর্ভুক্ত করেছে। GRPO পর্বে, একটি নিয়ম-ভিত্তিক পুরষ্কার ফাংশন (ফরম্যাট, ল্যান্ডমার্ক এক্সট্রাকশন, ম্যাপ ম্যাচিং, এবং অতিরিক্ত ল্যান্ডমার্ক পুরষ্কার সহ) ভিজ্যুয়াল ল্যাঙ্গুয়েজ স্থানীয়করণ প্রশিক্ষণের জন্য ব্যবহার করা হয়। পরীক্ষায় দেখা গেছে যে GRPO Astra-Global-এর সাধারণীকরণে উল্লেখযোগ্যভাবে উন্নতি করেছে, শুধুমাত্র SFT পদ্ধতির চেয়ে অদেখা অভ্যন্তরীণ পরিবেশে 99.9% স্থানীয়করণ নির্ভুলতা অর্জন করেছে।
Astra-স্থানীয়: স্থানীয় পরিকল্পনার জন্য স্মার্ট সহকারী
Astra-Local Astra-এর উচ্চ-ফ্রিকোয়েন্সি টাস্ক স্মার্ট অ্যাসিস্ট্যান্ট হিসেবে কাজ করে, একটি মাল্টিটাস্কিং নেটওয়ার্ক যা দক্ষতার সাথে স্থানীয় রুট তৈরি করতে এবং সেন্সর ডেটা থেকে দূরত্ব অনুসন্ধানের সঠিকভাবে অনুমান করতে সক্ষম। এর স্থাপত্যে তিনটি মূল উপাদান রয়েছে: ক 4D স্প্যাটিওটেম্পোরাল এনকোডারক পরিকল্পনা প্রধানএবং- দূরত্ব পরীক্ষার মাথা.

দ 4D স্প্যাটিওটেম্পোরাল এনকোডার প্রথাগত মোবাইল স্ট্যাক উপলব্ধি এবং ভবিষ্যদ্বাণী মডিউল প্রতিস্থাপন করে। আসতে শুরু করে 3D স্থানিক এনকোডার যা ভিশন ট্রান্সফরমার (ViT) এবং Lift-Splat-Shoot ব্যবহার করে 2D চিত্র বৈশিষ্ট্যগুলিকে 3D ভক্সেল বৈশিষ্ট্যে রূপান্তর করার জন্য N সর্বমুখী চিত্রগুলিকে প্রক্রিয়া করে। এই 3D এনকোডারটি 3D ভলিউম্যাট্রিক নিউরাল রেন্ডারিং ব্যবহার করে স্ব-তত্ত্বাবধানে লার্নিং ব্যবহার করে প্রশিক্ষিত। 3D স্প্যাটিওটেম্পোরাল এনকোডার 3D এনকোডারে তৈরি করে, রেসনেট এবং ডিআইটি মডিউল ব্যবহার করে ভবিষ্যত ভক্সেল বৈশিষ্ট্যগুলি ভবিষ্যদ্বাণী করতে ইনপুট হিসাবে অতীতের ভক্সেল বৈশিষ্ট্য এবং ভবিষ্যতের টাইমস্ট্যাম্প গ্রহণ করে এবং দূরত্ব পরিকল্পনা এবং পরীক্ষার জন্য বর্তমান এবং ভবিষ্যতের পরিবেশগত উপস্থাপনা প্রদান করে।
দ পরিকল্পনা প্রধানপ্রাক-প্রশিক্ষিত 4D বৈশিষ্ট্য, রোবট গতি এবং কাজের তথ্যের উপর ভিত্তি করে, ব্যবহার করে অপারেটিং ট্র্যাজেক্টোরি তৈরি করে ট্রান্সফরমার ভিত্তিক ফ্লাক্স ম্যাচিং. দ্বন্দ্ব প্রতিরোধ করার জন্য, পরিকল্পনা প্রধান ক ছদ্মবেশে ESDF এর ক্ষতি (ইউক্লিডীয় স্বাক্ষরিত দূরত্ব ক্ষেত্র)। এই ক্ষতি একটি 3D অকুপেন্সি ম্যাপের ESDF গণনা করে এবং একটি 2D গ্রাউন্ড ট্রুথ ট্রাজেক্টোরি মাস্ক প্রয়োগ করে, উল্লেখযোগ্যভাবে সংঘর্ষের হার কমিয়ে দেয়। পরীক্ষাগুলি অন্যান্য পদ্ধতির তুলনায় একটি আউট-অফ-ডিস্ট্রিবিউশন (OOD) ডেটাসেটে সংঘর্ষের হার এবং সামগ্রিক স্কোরে এর উচ্চতর কর্মক্ষমতা প্রদর্শন করে।
দ দূরত্ব পরীক্ষার মাথা বর্তমান এবং পূর্ববর্তী 4D বৈশিষ্ট্য এবং অতিরিক্ত সেন্সর ডেটা (যেমন, IMU, চাকা ডেটা) ব্যবহার করে রোবটের আপেক্ষিক ভঙ্গির পূর্বাভাস দেয়। এটি বিভিন্ন সেন্সর থেকে তথ্য একত্রিত করার জন্য একটি ট্রান্সফরমার মডেলকে প্রশিক্ষণ দেয়। প্রতিটি সেন্সর মোড একটি নির্দিষ্ট টোকেন দ্বারা প্রক্রিয়া করা হয়, মোডাল রিং এবং টেম্পোরাল পজিশন রিংগুলির সাথে মিলিত হয়, একটি ট্রান্সফরমার এনকোডারে খাওয়ানো হয় এবং শেষ পর্যন্ত আপেক্ষিক ভঙ্গির পূর্বাভাস দিতে CLS টোকেন ব্যবহার করে। পরীক্ষাগুলি মাল্টি-সেন্সর ফিউশন এবং ভঙ্গি অনুমানে অডিওমেট্রি হেডের চমৎকার কর্মক্ষমতা দেখিয়েছে, উল্লেখযোগ্যভাবে ঘূর্ণন নির্ভুলতা উন্নত করে এবং সামগ্রিক ট্র্যাজেক্টরি ত্রুটি হ্রাস করে।
পরীক্ষামূলক বৈধতা
Astra এর কর্মক্ষমতা ব্যাপকভাবে মূল্যায়ন করার জন্য বিভিন্ন গৃহমধ্যস্থ পরিবেশে (গুদাম, অফিস, বাড়ি) ব্যাপক পরীক্ষা চালানো হয়েছিল।
Astra-Global-এর মাল্টিমোডাল স্থানীয়করণ ক্ষমতা বিভিন্ন পরীক্ষা-নিরীক্ষার মাধ্যমে যাচাই করা হয়েছে, টেক্সট এবং ইমেজ লোকালাইজেশন প্রশ্নগুলি পরিচালনা করার ক্ষেত্রে উচ্চতর কর্মক্ষমতা প্রদর্শন করে। লক্ষ্য স্থানীয়করণের জন্য, এটি সঠিকভাবে টেক্সট কমান্ডের উপর ভিত্তি করে মিলিত ছবি এবং ভঙ্গি সনাক্ত করে (যেমন, “বিশ্রামের এলাকা খুঁজুন”)। প্রথাগত ভিজ্যুয়াল প্লেস রিকগনিশন (ভিপিআর) পদ্ধতির তুলনায়, অ্যাস্ট্রা-গ্লোবাল উল্লেখযোগ্য সুবিধাগুলি উপস্থাপন করে:
- বিস্তারিত ক্যাপচার করুন: বৈশ্বিক বৈশিষ্ট্যের উপর VPR-এর নির্ভরতার বিপরীতে, Astra-Global সঠিকভাবে সূক্ষ্ম বিবরণ ক্যাপচার করে যেমন রুম নম্বর, অনুরূপ দৃশ্যে স্থানীয়করণ ত্রুটি প্রতিরোধ করে।
- স্থিতিশীলতার দৃষ্টিকোণ: শব্দার্থিক ল্যান্ডমার্কের উপর ভিত্তি করে, Astra-Global ক্যামেরার কোণে বড় পরিবর্তনের সাথেও স্থিতিশীল স্থানীয়করণ বজায় রাখে, যেখানে VPR পদ্ধতি সাধারণত ব্যর্থ হয়।
- অবস্থান নির্ভুলতা: Astra-Global সবচেয়ে উপযুক্ত পোজ নির্বাচন করতে স্থানিক সম্পর্কের অগ্রগতি লাভ করে, যা ঐতিহ্যবাহী VPR-এর তুলনায় উল্লেখযোগ্যভাবে উচ্চতর পোজ নির্ভুলতা (1 মিটারের মধ্যে, 1 মিটার ত্রুটি দূরত্ব এবং 5 ডিগ্রী কোণ ত্রুটি) প্রদর্শন করে, গুদাম পরিবেশে 30% এর বেশি উন্নতির সাথে।



Astra-স্থানীয় নকশা মাথা এবং odometry পুঙ্খানুপুঙ্খভাবে পরীক্ষা করা হয়েছে. ডিজাইন হেড, ট্রান্সফরমার-ভিত্তিক ফ্লো ম্যাচিং এবং মুখোশযুক্ত ESDF ক্ষতি ব্যবহার করে, সংঘর্ষের হার, গতি, এবং OOD ডেটাসেটে সামগ্রিক স্কোরের ক্ষেত্রে ACT এবং নীতির বিস্তারের মতো পারফরম্যান্স পদ্ধতি। এটি সংঘর্ষের ঝুঁকি কমাতে ছদ্মবেশী ESDF-এর ক্ষতির কার্যকারিতা তুলে ধরে।
সিঙ্ক্রোনাইজড ইমেজ সিকোয়েন্স, আইএমইউ, হুইল ডেটা এবং ট্রু পোজ সহ মাল্টিমোডাল ডেটাসেটে ওডোমেট্রি হেডের কর্মক্ষমতা মূল্যায়ন করা হয়েছিল। দুই-ফ্রেম BEV-ODOM বেসলাইনের তুলনায়, Astra-স্থানীয় অডিওমেট্রি হেড মাল্টি-সেন্সর ফিউশন এবং পোজ অনুমানে উল্লেখযোগ্য সুবিধা দেখিয়েছে। IMU ডেটা অন্তর্ভুক্ত করা নাটকীয়ভাবে রোল অনুমানের নির্ভুলতা উন্নত করেছে, সামগ্রিক ট্র্যাজেক্টরি ত্রুটি প্রায় 2% কমিয়েছে। চাকা ডেটার অতিরিক্ত অন্তর্ভুক্তি স্কেলের স্থায়িত্ব এবং অনুমানের নির্ভুলতা উন্নত করেছে এবং এর উচ্চতর মাল্টি-সেন্সর ডেটা ফিউশন ক্ষমতা যাচাই করেছে।
Astra ভবিষ্যতের উন্নয়ন এবং অ্যাপ্লিকেশনের জন্য উল্লেখযোগ্য প্রতিশ্রুতি রাখে। এটির স্থাপনা আরও জটিল অভ্যন্তরীণ পরিবেশ যেমন বড় শপিং মল, হাসপাতাল এবং লাইব্রেরিতে প্রসারিত করা যেতে পারে, যেখানে এটি সঠিক পণ্য স্থাপন, দক্ষ চিকিৎসা সরবরাহ সরবরাহ এবং বই সংস্থার মতো কাজগুলিতে সহায়তা করতে পারে।
যাইহোক, উন্নতির জন্য ক্ষেত্র আছে. Astra-Global-এর জন্য, বর্তমান মানচিত্রের উপস্থাপনা তথ্যের ক্ষতি এবং টোকেন দৈর্ঘ্যের ভারসাম্য বজায় রাখলেও, তাদের মাঝে মাঝে সমালোচনামূলক শব্দার্থগত বিবরণের অভাব হতে পারে। ভবিষ্যত কাজ শব্দার্থগত তথ্যের সর্বোচ্চ সংরক্ষণের সময় দক্ষতা অপ্টিমাইজ করার জন্য বিকল্প মানচিত্র সংকোচন পদ্ধতিতে ফোকাস করবে। উপরন্তু, বর্তমান একক-ফ্রেম স্থানীয়করণ বৈশিষ্ট্য-দরিদ্র বা অত্যন্ত পুনরাবৃত্তিমূলক পরিবেশে ব্যর্থ হতে পারে; ভবিষ্যত পরিকল্পনার মধ্যে রয়েছে সক্রিয় তদন্ত প্রক্রিয়া এবং শক্তিশালী স্থানীয়করণের জন্য সাময়িক যুক্তি।
অ্যাস্ট্রা-লোকালের জন্য, আউট-অফ-ডিস্ট্রিবিউশন (OOD) পরিস্থিতিতে দৃঢ়তা উন্নত করা অপরিহার্য, উন্নত মডেল আর্কিটেকচার এবং প্রশিক্ষণ পদ্ধতির প্রয়োজন। সিস্টেমের স্থিতিশীলতা উন্নত করার জন্য কঠোর সংহতকরণ এবং বিরামবিহীন স্যুইচিংয়ের জন্য প্রতিক্রিয়া সিস্টেমের একটি পুনঃডিজাইনও পরিকল্পনা করা হয়েছে। তদ্ব্যতীত, নির্দেশনা-অনুসরণীয় ক্ষমতাগুলিকে অন্তর্ভুক্ত করা রোবটকে প্রাকৃতিক ভাষার আদেশগুলি বুঝতে এবং কার্যকর করতে, গতিশীল, মানব-কেন্দ্রিক পরিবেশে তাদের উপযোগিতা প্রসারিত করতে এবং আরও প্রাকৃতিক মানব-রোবট মিথস্ক্রিয়াকে উত্সাহিত করবে।