ভিডিও ওয়ার্ল্ড মডেলগুলি, যা ভবিষ্যত ফ্রেমের ভবিষ্যদ্বাণী করে ক্রিয়াকলাপের উপর, কৃত্রিম বুদ্ধিমত্তার জন্য বিশাল প্রতিশ্রুতি রাখে, এজেন্টদের গতিশীল পরিবেশে পরিকল্পনা করতে এবং প্রতিক্রিয়া জানাতে সক্ষম করে। সাম্প্রতিক অগ্রগতি, বিশেষ করে ভিডিও স্ক্যাটারিং মডেলগুলির সাথে, বাস্তবসম্মত ভবিষ্যত ক্রম তৈরিতে চিত্তাকর্ষক ক্ষমতা দেখিয়েছে। যাইহোক, একটি উল্লেখযোগ্য বাধা রয়ে গেছে: দীর্ঘমেয়াদী স্মৃতি ধরে রাখা। প্রথাগত মনোযোগী স্তরগুলি ব্যবহার করে প্রসারিত ক্রম প্রক্রিয়াকরণের সাথে যুক্ত উচ্চ গণনামূলক খরচের কারণে বর্তমান মডেলগুলি অতীতের দূরবর্তী ঘটনা এবং পরিস্থিতি মনে রাখতে সংগ্রাম করে। এটি তাদের জটিল কাজগুলি সম্পাদন করার ক্ষমতাকে সীমিত করে যার জন্য একটি দৃশ্যের ক্রমাগত বোঝার প্রয়োজন হয়।
স্ট্যানফোর্ড ইউনিভার্সিটি, প্রিন্সটন ইউনিভার্সিটি এবং অ্যাডোব রিসার্চের গবেষকদের দ্বারা “লং-কনটেক্সট স্টেট-স্পেস ভিডিও ওয়ার্ল্ড মডেল” একটি নতুন কাগজ, এই চ্যালেঞ্জের একটি উদ্ভাবনী সমাধান প্রদান করে। তারা একটি উদ্ভাবনী স্থাপত্য উপস্থাপন করে যা লিভারেজ করে স্টেট-স্পেস মডেল (SSMs) কম্পিউটেশনাল দক্ষতা বলিদান ছাড়াই অস্থায়ী মেমরি প্রসারিত করুন।
মূল সমস্যাটি অনুক্রমের দৈর্ঘ্যের সাথে মনোযোগের প্রক্রিয়াগুলির দ্বিঘাত গণনাগত জটিলতার মধ্যে রয়েছে। ভিডিও সংযোগ বাড়ার সাথে সাথে মনোযোগের স্তরগুলির জন্য প্রয়োজনীয় সংস্থানগুলি বিস্ফোরিত হয়, যা বাস্তব বিশ্বের অ্যাপ্লিকেশনগুলির জন্য দীর্ঘমেয়াদী মেমরিকে অব্যবহারিক করে তোলে৷ এর মানে হল যে নির্দিষ্ট সংখ্যক ফ্রেমের পরে, মডেলটি কার্যকরভাবে আগের ঘটনাগুলিকে “ভুলে যায়”, যা দীর্ঘমেয়াদী সংগতি বা যুক্তির প্রয়োজন হয় এমন কাজগুলিতে তার কার্যকারিতাকে বাধা দেয়।
লেখকদের মূল অন্তর্দৃষ্টি হল কার্যকারণ সিকোয়েন্স মডেলের জন্য স্টেট-স্পেস মডেলের (SSMs) অন্তর্নিহিত শক্তিগুলিকে কাজে লাগানো। পূর্ববর্তী প্রচেষ্টার বিপরীতে যেগুলি SSM সিস্টেমগুলিকে অ-কারণমূলক দৃষ্টি কার্যগুলিতে পুনরায় অভিযোজিত করেছিল, এই কাজটি দক্ষ ক্রম প্রক্রিয়াকরণে তাদের সুবিধার সম্পূর্ণ সুবিধা গ্রহণ করে।
প্রস্তাবিত লং কনটেক্সট স্টেট-স্পেস ভিডিও ওয়ার্ল্ড মডেল (LSSVWM) বেশ কয়েকটি প্রয়োজনীয় নকশা বিকল্প একত্রিত করে:
- ব্লকিং এ এসএসএম স্ক্যান প্রোগ্রাম: এটি তাদের নকশার কেন্দ্রবিন্দু। একটি একক SSM স্ক্যানের মাধ্যমে সম্পূর্ণ ভিডিও ক্রম প্রক্রিয়াকরণের পরিবর্তে, তারা একটি ব্লক প্রোগ্রাম ব্যবহার করে। এটি কৌশলগতভাবে উল্লেখযোগ্যভাবে প্রসারিত অস্থায়ী স্মৃতির জন্য কিছু স্থানিক সামঞ্জস্য (একটি ব্লকের মধ্যে) ব্যবসা করে। দীর্ঘ ক্রমকে পরিচালনাযোগ্য ব্লকে ভেঙ্গে, তারা একটি সংকুচিত “স্থিতি” বজায় রাখতে পারে যা ব্লক জুড়ে তথ্য বহন করে, কার্যকরভাবে মডেলের মেমরি দিগন্তকে প্রসারিত করে।
- ঘন স্থানীয় মনোযোগ: ব্লক SSM স্ক্যানিং দ্বারা প্রবর্তিত স্থানিক সমন্বয়ের সম্ভাব্য ক্ষতির জন্য ক্ষতিপূরণের জন্য, মডেলটি ঘন স্থানীয় মনোযোগ অন্তর্ভুক্ত করে। এটি নিশ্চিত করে যে ব্লকের মধ্যে এবং জুড়ে ক্রমাগত ফ্রেমগুলি দৃঢ় সম্পর্ক বজায় রাখে, বাস্তবসম্মত ভিডিও তৈরি করার জন্য প্রয়োজনীয় সূক্ষ্ম বিবরণ এবং ধারাবাহিকতা বজায় রাখে। গ্লোবাল প্রসেসিং (SSM) এবং স্থানীয় প্রক্রিয়াকরণ (মনোযোগ) এর এই দ্বৈত পদ্ধতি তাদের দীর্ঘমেয়াদী স্মৃতি এবং স্থানীয় বিশ্বস্ততা উভয়ই অর্জন করতে দেয়।

দীর্ঘ প্রেক্ষাপটে কর্মক্ষমতা আরও উন্নত করতে নিবন্ধটি দুটি মূল প্রশিক্ষণ কৌশলও উপস্থাপন করে:
- বিস্তার জোরপূর্বক: এই কৌশলটি মডেলটিকে ইনপুটের উপসর্গের উপর শর্তযুক্ত ফ্রেম তৈরি করতে উত্সাহিত করে, মূলত এটিকে দীর্ঘ সময়ের জন্য ধারাবাহিকতা বজায় রাখতে শিখতে বাধ্য করে। কখনও কখনও একটি উপসর্গের নমুনা না নিয়ে এবং সমস্ত টোকেনকে শব্দে না রেখে, প্রশিক্ষণটি একটি প্রসারণ সীমাবদ্ধতার সমতুল্য হয়ে ওঠে, যা একটি দীর্ঘ প্রেক্ষাপটের সাথে প্রশিক্ষণের একটি বিশেষ ক্ষেত্রে হাইলাইট করা হয় যেখানে উপসর্গের দৈর্ঘ্য শূন্য। এটি ন্যূনতম প্রাথমিক প্রসঙ্গ থেকেও সুসংগত ক্রম তৈরি করতে মডেলটিকে ঠেলে দেয়।
- স্থানীয় মনোযোগ কাঠামো: দ্রুত প্রশিক্ষণ এবং নমুনা নেওয়ার জন্য, লেখকরা “ফ্রেমে স্থানীয় মনোযোগ” প্রক্রিয়া প্রয়োগ করেছেন। এটি একটি সম্পূর্ণ কার্যকারণ মুখোশের তুলনায় উল্লেখযোগ্য গতি অর্জন করতে ফ্লেক্সঅ্যাটেনশন ব্যবহার করে। ফ্রেমগুলিকে খণ্ডে বিভক্ত করে (যেমন, 10-এর ফ্রেমের উইন্ডোর আকার সহ 5-এর খণ্ড), একটি খণ্ডের মধ্যে থাকা ফ্রেমগুলি দ্বিমুখীতা বজায় রাখে এবং পূর্ববর্তী খণ্ডে ফ্রেমগুলিকে উল্লেখ করে। কম্পিউটেশনাল লোড অপ্টিমাইজ করার সময় এটি একটি দক্ষ প্রাপ্তি ক্ষেত্র সক্ষম করে।

গবেষকরা তাদের LSSVWM-কে চ্যালেঞ্জিং ডেটাসেটের উপর মূল্যায়ন করেছেন, সহ মেমরি গোলকধাঁধা এবং মাইনক্রাফ্টযা বিশেষভাবে পুনরুদ্ধার এবং স্থানিক বিচার কার্যের মাধ্যমে দীর্ঘমেয়াদী মেমরি ক্ষমতা পরীক্ষা করার জন্য ডিজাইন করা হয়েছে।
পরীক্ষাগুলি প্রমাণ করে যে তাদের পদ্ধতি উল্লেখযোগ্যভাবে বেসলাইন অতিক্রম করে দীর্ঘমেয়াদী স্মৃতি ধরে রাখার ক্ষেত্রে। গুণগত ফলাফল, যেমন পরিপূরক চিত্রগুলিতে দেখানো হয়েছে (যেমন, S1, S2, S3), চিত্রিত করে যে LSSVWM শুধুমাত্র কার্যকারণ মনোযোগের উপর নির্ভরশীল মডেলগুলির তুলনায় বা ফ্রেমে স্থানীয় মনোযোগ ছাড়াই Mamba2-এর তুলনায় বর্ধিত সময়ের জন্য আরও সুসঙ্গত এবং সঠিক ক্রম তৈরি করতে পারে। উদাহরণস্বরূপ, গোলকধাঁধা ডেটাসেটের জন্য যুক্তিযুক্ত কাজগুলিতে, তাদের মডেল দীর্ঘ দিগন্তে আরও ভাল ধারাবাহিকতা এবং নির্ভুলতা বজায় রাখে। একইভাবে, পুনরুদ্ধারের কাজগুলির জন্য, LSSVWM দূরবর্তী অতীতের ফ্রেমগুলি থেকে তথ্য মনে রাখার এবং ব্যবহার করার একটি উন্নত ক্ষমতা দেখায়। অত্যন্ত গুরুত্বপূর্ণভাবে, ব্যবহারিক অনুমান গতি বজায় রাখার সময় এই উন্নতিগুলি অর্জন করা হয়, মডেলগুলিকে ইন্টারেক্টিভ অ্যাপ্লিকেশনের জন্য উপযুক্ত করে তোলে।

কাগজ দীর্ঘ-সম্পর্কের রাষ্ট্র-স্থানের প্রেক্ষাপট সহ ভিডিও বিশ্ব মডেল arXiv এ পাওয়া গেছে