Adobe গবেষণা স্টেট-স্পেস মডেলের সাথে ভিডিও ওয়ার্ল্ড মডেলগুলিতে দীর্ঘমেয়াদী মেমরি আনলক করে | সিঙ্ক্রোনাইজড

Adobe গবেষণা স্টেট-স্পেস মডেলের সাথে ভিডিও ওয়ার্ল্ড মডেলগুলিতে দীর্ঘমেয়াদী মেমরি আনলক করে | সিঙ্ক্রোনাইজড

নেপাল বনাম নামিবিয়া


ভিডিও ওয়ার্ল্ড মডেলগুলি, যা ভবিষ্যত ফ্রেমের ভবিষ্যদ্বাণী করে ক্রিয়াকলাপের উপর, কৃত্রিম বুদ্ধিমত্তার জন্য বিশাল প্রতিশ্রুতি রাখে, এজেন্টদের গতিশীল পরিবেশে পরিকল্পনা করতে এবং প্রতিক্রিয়া জানাতে সক্ষম করে। সাম্প্রতিক অগ্রগতি, বিশেষ করে ভিডিও স্ক্যাটারিং মডেলগুলির সাথে, বাস্তবসম্মত ভবিষ্যত ক্রম তৈরিতে চিত্তাকর্ষক ক্ষমতা দেখিয়েছে। যাইহোক, একটি উল্লেখযোগ্য বাধা রয়ে গেছে: দীর্ঘমেয়াদী স্মৃতি ধরে রাখা। প্রথাগত মনোযোগী স্তরগুলি ব্যবহার করে প্রসারিত ক্রম প্রক্রিয়াকরণের সাথে যুক্ত উচ্চ গণনামূলক খরচের কারণে বর্তমান মডেলগুলি অতীতের দূরবর্তী ঘটনা এবং পরিস্থিতি মনে রাখতে সংগ্রাম করে। এটি তাদের জটিল কাজগুলি সম্পাদন করার ক্ষমতাকে সীমিত করে যার জন্য একটি দৃশ্যের ক্রমাগত বোঝার প্রয়োজন হয়।

স্ট্যানফোর্ড ইউনিভার্সিটি, প্রিন্সটন ইউনিভার্সিটি এবং অ্যাডোব রিসার্চের গবেষকদের দ্বারা “লং-কনটেক্সট স্টেট-স্পেস ভিডিও ওয়ার্ল্ড মডেল” একটি নতুন কাগজ, এই চ্যালেঞ্জের একটি উদ্ভাবনী সমাধান প্রদান করে। তারা একটি উদ্ভাবনী স্থাপত্য উপস্থাপন করে যা লিভারেজ করে স্টেট-স্পেস মডেল (SSMs) কম্পিউটেশনাল দক্ষতা বলিদান ছাড়াই অস্থায়ী মেমরি প্রসারিত করুন।

মূল সমস্যাটি অনুক্রমের দৈর্ঘ্যের সাথে মনোযোগের প্রক্রিয়াগুলির দ্বিঘাত গণনাগত জটিলতার মধ্যে রয়েছে। ভিডিও সংযোগ বাড়ার সাথে সাথে মনোযোগের স্তরগুলির জন্য প্রয়োজনীয় সংস্থানগুলি বিস্ফোরিত হয়, যা বাস্তব বিশ্বের অ্যাপ্লিকেশনগুলির জন্য দীর্ঘমেয়াদী মেমরিকে অব্যবহারিক করে তোলে৷ এর মানে হল যে নির্দিষ্ট সংখ্যক ফ্রেমের পরে, মডেলটি কার্যকরভাবে আগের ঘটনাগুলিকে “ভুলে যায়”, যা দীর্ঘমেয়াদী সংগতি বা যুক্তির প্রয়োজন হয় এমন কাজগুলিতে তার কার্যকারিতাকে বাধা দেয়।

লেখকদের মূল অন্তর্দৃষ্টি হল কার্যকারণ সিকোয়েন্স মডেলের জন্য স্টেট-স্পেস মডেলের (SSMs) অন্তর্নিহিত শক্তিগুলিকে কাজে লাগানো। পূর্ববর্তী প্রচেষ্টার বিপরীতে যেগুলি SSM সিস্টেমগুলিকে অ-কারণমূলক দৃষ্টি কার্যগুলিতে পুনরায় অভিযোজিত করেছিল, এই কাজটি দক্ষ ক্রম প্রক্রিয়াকরণে তাদের সুবিধার সম্পূর্ণ সুবিধা গ্রহণ করে।

প্রস্তাবিত লং কনটেক্সট স্টেট-স্পেস ভিডিও ওয়ার্ল্ড মডেল (LSSVWM) বেশ কয়েকটি প্রয়োজনীয় নকশা বিকল্প একত্রিত করে:

  1. ব্লকিং এ এসএসএম স্ক্যান প্রোগ্রাম: এটি তাদের নকশার কেন্দ্রবিন্দু। একটি একক SSM স্ক্যানের মাধ্যমে সম্পূর্ণ ভিডিও ক্রম প্রক্রিয়াকরণের পরিবর্তে, তারা একটি ব্লক প্রোগ্রাম ব্যবহার করে। এটি কৌশলগতভাবে উল্লেখযোগ্যভাবে প্রসারিত অস্থায়ী স্মৃতির জন্য কিছু স্থানিক সামঞ্জস্য (একটি ব্লকের মধ্যে) ব্যবসা করে। দীর্ঘ ক্রমকে পরিচালনাযোগ্য ব্লকে ভেঙ্গে, তারা একটি সংকুচিত “স্থিতি” বজায় রাখতে পারে যা ব্লক জুড়ে তথ্য বহন করে, কার্যকরভাবে মডেলের মেমরি দিগন্তকে প্রসারিত করে।
  2. ঘন স্থানীয় মনোযোগ: ব্লক SSM স্ক্যানিং দ্বারা প্রবর্তিত স্থানিক সমন্বয়ের সম্ভাব্য ক্ষতির জন্য ক্ষতিপূরণের জন্য, মডেলটি ঘন স্থানীয় মনোযোগ অন্তর্ভুক্ত করে। এটি নিশ্চিত করে যে ব্লকের মধ্যে এবং জুড়ে ক্রমাগত ফ্রেমগুলি দৃঢ় সম্পর্ক বজায় রাখে, বাস্তবসম্মত ভিডিও তৈরি করার জন্য প্রয়োজনীয় সূক্ষ্ম বিবরণ এবং ধারাবাহিকতা বজায় রাখে। গ্লোবাল প্রসেসিং (SSM) এবং স্থানীয় প্রক্রিয়াকরণ (মনোযোগ) এর এই দ্বৈত পদ্ধতি তাদের দীর্ঘমেয়াদী স্মৃতি এবং স্থানীয় বিশ্বস্ততা উভয়ই অর্জন করতে দেয়।
Adobe গবেষণা স্টেট-স্পেস মডেলের সাথে ভিডিও ওয়ার্ল্ড মডেলগুলিতে দীর্ঘমেয়াদী মেমরি আনলক করে | সিঙ্ক্রোনাইজড

দীর্ঘ প্রেক্ষাপটে কর্মক্ষমতা আরও উন্নত করতে নিবন্ধটি দুটি মূল প্রশিক্ষণ কৌশলও উপস্থাপন করে:

  • বিস্তার জোরপূর্বক: এই কৌশলটি মডেলটিকে ইনপুটের উপসর্গের উপর শর্তযুক্ত ফ্রেম তৈরি করতে উত্সাহিত করে, মূলত এটিকে দীর্ঘ সময়ের জন্য ধারাবাহিকতা বজায় রাখতে শিখতে বাধ্য করে। কখনও কখনও একটি উপসর্গের নমুনা না নিয়ে এবং সমস্ত টোকেনকে শব্দে না রেখে, প্রশিক্ষণটি একটি প্রসারণ সীমাবদ্ধতার সমতুল্য হয়ে ওঠে, যা একটি দীর্ঘ প্রেক্ষাপটের সাথে প্রশিক্ষণের একটি বিশেষ ক্ষেত্রে হাইলাইট করা হয় যেখানে উপসর্গের দৈর্ঘ্য শূন্য। এটি ন্যূনতম প্রাথমিক প্রসঙ্গ থেকেও সুসংগত ক্রম তৈরি করতে মডেলটিকে ঠেলে দেয়।
  • স্থানীয় মনোযোগ কাঠামো: দ্রুত প্রশিক্ষণ এবং নমুনা নেওয়ার জন্য, লেখকরা “ফ্রেমে স্থানীয় মনোযোগ” প্রক্রিয়া প্রয়োগ করেছেন। এটি একটি সম্পূর্ণ কার্যকারণ মুখোশের তুলনায় উল্লেখযোগ্য গতি অর্জন করতে ফ্লেক্সঅ্যাটেনশন ব্যবহার করে। ফ্রেমগুলিকে খণ্ডে বিভক্ত করে (যেমন, 10-এর ফ্রেমের উইন্ডোর আকার সহ 5-এর খণ্ড), একটি খণ্ডের মধ্যে থাকা ফ্রেমগুলি দ্বিমুখীতা বজায় রাখে এবং পূর্ববর্তী খণ্ডে ফ্রেমগুলিকে উল্লেখ করে। কম্পিউটেশনাল লোড অপ্টিমাইজ করার সময় এটি একটি দক্ষ প্রাপ্তি ক্ষেত্র সক্ষম করে।

গবেষকরা তাদের LSSVWM-কে চ্যালেঞ্জিং ডেটাসেটের উপর মূল্যায়ন করেছেন, সহ মেমরি গোলকধাঁধা এবং মাইনক্রাফ্টযা বিশেষভাবে পুনরুদ্ধার এবং স্থানিক বিচার কার্যের মাধ্যমে দীর্ঘমেয়াদী মেমরি ক্ষমতা পরীক্ষা করার জন্য ডিজাইন করা হয়েছে।

পরীক্ষাগুলি প্রমাণ করে যে তাদের পদ্ধতি উল্লেখযোগ্যভাবে বেসলাইন অতিক্রম করে দীর্ঘমেয়াদী স্মৃতি ধরে রাখার ক্ষেত্রে। গুণগত ফলাফল, যেমন পরিপূরক চিত্রগুলিতে দেখানো হয়েছে (যেমন, S1, S2, S3), চিত্রিত করে যে LSSVWM শুধুমাত্র কার্যকারণ মনোযোগের উপর নির্ভরশীল মডেলগুলির তুলনায় বা ফ্রেমে স্থানীয় মনোযোগ ছাড়াই Mamba2-এর তুলনায় বর্ধিত সময়ের জন্য আরও সুসঙ্গত এবং সঠিক ক্রম তৈরি করতে পারে। উদাহরণস্বরূপ, গোলকধাঁধা ডেটাসেটের জন্য যুক্তিযুক্ত কাজগুলিতে, তাদের মডেল দীর্ঘ দিগন্তে আরও ভাল ধারাবাহিকতা এবং নির্ভুলতা বজায় রাখে। একইভাবে, পুনরুদ্ধারের কাজগুলির জন্য, LSSVWM দূরবর্তী অতীতের ফ্রেমগুলি থেকে তথ্য মনে রাখার এবং ব্যবহার করার একটি উন্নত ক্ষমতা দেখায়। অত্যন্ত গুরুত্বপূর্ণভাবে, ব্যবহারিক অনুমান গতি বজায় রাখার সময় এই উন্নতিগুলি অর্জন করা হয়, মডেলগুলিকে ইন্টারেক্টিভ অ্যাপ্লিকেশনের জন্য উপযুক্ত করে তোলে।

কাগজ দীর্ঘ-সম্পর্কের রাষ্ট্র-স্থানের প্রেক্ষাপট সহ ভিডিও বিশ্ব মডেল arXiv এ পাওয়া গেছে



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *