লেখক(গুলি): মেংলিউ ঝাও
মূলত টুওয়ার্ডস এআই-তে পোস্ট করা হয়েছে।
কিমি সিরিজের সর্বশেষ মডেল, K3, 2.8 ট্রিলিয়ন প্যারামিটারে উন্নীত হয়েছে। চিত্তাকর্ষক
মুনশট এআই-এর কিমি K3 প্রযুক্তিগত প্রতিবেদনটি এমন একটি মডেলের সাথে খোলে যা, কাগজে, কিমি K2–2.8T সামগ্রিক প্যারামিটার, 104B সক্ষম, 1M-টোকেন প্রসঙ্গ উইন্ডো এবং আসল দৃশ্যের আকারের প্রায় তিনগুণ। ক্ষতির তুলনা কিমি K2-এর তুলনায় 2.5X স্কেল দক্ষতা দেখায় – স্কেলিং আইন এখনও তার জায়গা আছে তার আরও প্রমাণ। যাইহোক, স্কেলিংয়ের আইনটি নিজেই “কী কাজ করে” এর প্রমাণ – তবে মৌলিক প্রশ্ন, “কীভাবে জিনিসগুলি কাজ করে”, রিপোর্টের আসল চাবিকাঠি।
এই নিবন্ধে, আমি চারটি স্থাপত্য ধারণার উপরে যাব যা কিমি কে 3 এর স্কেলকে অ্যাক্সেসযোগ্য করে তোলে:
- মনোযোগের মূল আর্কিটেকচার: সঙ্গে রৈখিক মনোযোগ কিমি ডেল্টা মনোযোগ (KDA) চ এমএলএ বন্ধ NoPE সহ
- অবশিষ্ট মনোযোগ গভীর জুড়ে
- গোপন MoE পরিমাণ-ভিত্তিক লোড ব্যালেন্সিং সহ
- এবং এছাড়াও একটি ভিশন টাওয়ার কোনো বৈসাদৃশ্যপূর্ণ প্রাক-প্রশিক্ষণ ছাড়াই প্রশিক্ষিত
এটি তখন অবকাঠামোর সহ-ডিজাইন দিয়ে বন্ধ হয়ে যায় যা এই সমস্ত কিছুর পাশাপাশি ঘটতে হয়েছিল, ডিপসিক V3 দিয়ে শুরু হওয়া একটি প্রবণতা অব্যাহত রেখে।
মনোযোগের মূল আর্কিটেকচার
মূল মনোযোগ স্তরটিতে 3টি কেডিএ স্তর + 1টি গেটেড এমএলএ স্তর রয়েছে, প্রতিটির পরে একটি স্থিতিশীল LatentMoE স্তর রয়েছে (যার বিষয়ে আমরা পরে কথা বলব)। প্রথমে আমরা কেডিএ স্তর ব্যাখ্যা করব।
কিমি ডেল্টা অ্যাটেনশন (কেডিএ)
কিমি K3 ডিফল্ট সিকোয়েন্স মিক্সার হিসাবে ক্লাসিক মাল্টি-হেড অ্যাটেনশন ব্যবহার করে না। পরিবর্তে, চারটি মনোযোগী স্তরের মধ্যে তিনটি কিমি ডেল্টা অ্যাটেনশন (কেডিএ)লিনিয়ার অ্যাটেনশন মেকানিজম প্রথমে কিমি লিনিয়ার (2025) এ প্রস্তাব করা হয়েছিল এবং সরাসরি উৎস করা হয়েছিল গেটেড ডেল্টানেট.
ডেল্টানেটের ধারণাটি সহজ: ভ্যানিলা লিনিয়ার অ্যাটেনশন ডিজাইনের কারণে সৃষ্ট নিম্ন কর্মক্ষমতা সমস্যা সমাধানের জন্য, লিনিয়ার রিগ্রেশন আপডেট করার জন্য একটি সাধারণ হোস্ট রূপান্তরের উপর ভিত্তি করে একটি ডেল্টা নিয়ম প্রস্তাব করা হয়েছিল:
তারপর Gated DeltaNet শেখার প্রক্রিয়াকে আরও স্থিতিশীল করতে আরেকটি স্কেলার ভুলে গেট যোগ করেছে:
কি কিমি ডেল্টা অ্যাটেনশন (কেডিএ) ক্ষয়ের সূক্ষ্ম নিয়ন্ত্রণের জন্য তিনি একটি তির্যক গেট যোগ করেছেন:
কম্পিউটেশনাল দক্ষতা উন্নত করার জন্য, কেডিএ একটি পার্সিং-সমান্তরাল বিন্যাসে পুনরায় লেখা যেতে পারে (যা রৈখিক মনোযোগ গণনার জন্য একটি সাধারণ বিন্যাস)। সঠিক স্লাইডিং সমস্যা সমাধানের জন্য, ক্ষয় লগিটগুলিকে সম্পর্কিত করার জন্য একটি নেতিবাচক-সফটপ্লাস ম্যাপিং চালু করা হয়েছে।
গেটেড এমএলএ এবং নো পজিশন এনকোডিং (NoPE)
দ বদ্ধ মাথার মনোযোগ (এমএলএ) তিনি ক মনোযোগের সময়ে প্রতিটি মাথার জন্য পূর্বাভাস পুনর্নির্মাণের আগে একটি নিম্ন-র্যাঙ্ক শেয়ার্ড ল্যাটেন্টে কী এবং মান কম্প্রেস করে KV ক্যাশে সঙ্কুচিত করার জন্য DeepSeek-V2 প্রক্রিয়া চালু করা হয়েছে। যদিও ক্লাসিক এমএলএ অবস্থানগত তথ্য ইনজেক্ট করার জন্য RoPE প্রয়োগ করে, কিমি K3 এটি সম্পূর্ণভাবে ড্রপ করে – এর এমএলএ স্তরগুলি ব্যবহার করে NoPE (কোন অবস্থান এনকোডিং নেই). যুক্তিটি স্থাপত্যগত: কেডিএ স্তরগুলি ইতিমধ্যেই তাদের পুনরাবৃত্তিমূলক ক্ষয়ের মাধ্যমে অবস্থান-সংবেদনশীল, সাম্প্রতিক-কাল-সচেতন মিশ্রণ সরবরাহ করে, তাই এমএলএ স্তরগুলি তারা যা করতে পারে তা করার জন্য মুক্ত হয়। এটি একটি দীর্ঘ প্রসঙ্গে একটি খুব ব্যবহারিক মাথাব্যথাকেও বাইপাস করে: রিটিউন করার জন্য কোন ROPE ফ্রিকোয়েন্সি বেস নেই, প্রসঙ্গ দৈর্ঘ্য প্রসারিত করার সময় YaRN ইন্টারপোলেশনের প্রয়োজন নেইকারণ প্রথম স্থানে প্রতিস্থাপন করার জন্য কোন ঘূর্ণনগত এম্বেডিং নেই। এর উপরে, K3 এমএলএ-তে একটি পূর্ণ-স্কেল, ইনপুট-নির্ভর আউটপুট গেট যোগ করে (কেডিএ-তে একটি অনুরূপ গেটকে মিরর করে), প্রতিটি টোকেন বিশ্বব্যাপী মনোযোগ থেকে কোন চ্যানেলগুলি পড়তে পারে তা নিয়ন্ত্রণ করতে দেয়।
অবশিষ্ট মনোযোগ: একটি ধারাবাহিকতা হিসাবে গভীরতা উপলব্ধি করা
এটি সম্ভবত প্রযুক্তিগত প্রতিবেদন দ্বারা প্রস্তাবিত সবচেয়ে আকর্ষণীয় ধারণাগুলির মধ্যে একটি: ট্রান্সফরমারগুলি মনোযোগের উপর অবিচ্ছিন্ন নির্ভরতাকে কীভাবে আচরণ করে তার অনুরূপ, অবশিষ্ট মনোযোগ মনোযোগ বিন্যাসে অবশিষ্ট গঠন করার চেষ্টা করা হচ্ছে:
Kimi K3 আর্কিটেকচারে স্যুইচ করার সময়, এর অর্থ হল এক জোড়া স্তরের জন্য অবশিষ্টাংশ গণনা করা:
মডেলের গভীরতা < 100 দেওয়া, সম্পূর্ণ গণনা খরচ হল O(L²d), যা এখনও যুক্তিসঙ্গত, এবং অবশিষ্টাংশ গণনা করা ব্লক শৈলী হলে তা হ্রাস করা যেতে পারে।
তাহলে কেন এই ধরনের একটি স্তর শৈলী মধ্যে অবশিষ্টাংশ যোগ করুন? কারণটি সহজ – কিমি কে 3 স্তরের সংখ্যা বাড়িয়ে 93 করেছে, কিমি কে 2 এর সাথে তুলনা করার সময় মাত্র 61টি স্তর রয়েছে৷ মডেল স্তরের 52% বৃদ্ধি গ্রেডিয়েন্ট ব্যাকপ্রোপাগেশনে একটি বিশাল বাধা সৃষ্টি করে – যা ক্লাসিক্যাল স্কিপ কাপলিং দ্বারা সমাধান করা যায় না, এবং একটি ঘন উপস্থাপনা প্রয়োজন।
স্থিতিশীল LatentMoE: ভারসাম্য না হারিয়ে ~1,000 বিশেষজ্ঞদের স্কেল করুন
Kimi K3 তার MoE আর্কিটেকচারে বিশেষজ্ঞদের সংখ্যাকে আরও অনেক বেশি এগিয়ে দেয় – 896 রাউটেড বিশেষজ্ঞ প্রতি টোকেনে 16 সক্রিয় (K2 এর 384 রাউটেড / 8 সক্রিয়ের তুলনায়) – এবং স্পারসিটিতে অতিরিক্ত 133% লাফ দুটি জিনিস ভেঙে দেয় যা আগে একটি ছোট স্কেলে ভাল কাজ করেছিল।
স্থাপত্য ফিক্স হয় LatentMoE: ভাগ করা বিশেষজ্ঞরা এখনও মডেলের সম্পূর্ণ লুকানো প্রস্থে কাজ করে, কিন্তু রাউট করা বিশেষজ্ঞরা অনেক বেশি সংকীর্ণ লুকানো জায়গায় কাজ করে, লঞ্চের আগে নিম্নগামী অভিক্ষেপ এবং একত্রিত হওয়ার পরে ঊর্ধ্বমুখী অভিক্ষেপের মাধ্যমে পৌঁছায়। এটি সম্পূর্ণ মডেল প্রস্থ থেকে রাউটারের খরচকে দ্বিগুণ করে, যা টোকেন প্রতি 896 বিশেষজ্ঞের মধ্যে 16 জনকে সবচেয়ে সার্থক করে তোলে।
তবে স্থিতিশীলতার সমস্যা রয়ে গেছে। Kimi K3 এই দুটি পদ্ধতির সম্বোধন করে: ক) প্রজেকশন আপ + নতুন অ্যাক্টিভেশন ফাংশনের আগে RMMSMorm সহ, সিটু-গ্লু (Sigmoid Tanh Unit GLU), যা একটি SwiGLU-শৈলীর গেটের উভয় শাখাকে স্কেল করা Tanh-এ কভার করে – যখন SwiGLU ভালভাবে কাজ করে, যা আউটপুটকে আবদ্ধ করে যাতে বড় আকারের স্থানাঙ্কগুলি কম নির্ভুলতায় বিস্ফোরিত না হতে পারে; আমি) পরিমাণগত ভারসাম্য: সরাসরি বিশেষজ্ঞের পক্ষপাতকে স্কোর কোয়ান্টাইলে সেট করে যা সেই বিশেষজ্ঞকে তার সাথে প্রদান করবে লক্ষ্য লোড, রাউটিং মার্জিনের হিস্টোগ্রাম থেকে প্রতিটি প্রশিক্ষণের ধাপের জন্য অনুমান করা হয় (একটি সঠিক পরিমাণের জন্য লক্ষ লক্ষ পৃথক মান সংগ্রহ করা এড়াতে)।
একজন দৃষ্টি উৎপাদনকারী যার বিপরীত প্রাক-প্রশিক্ষণের প্রয়োজন নেই
প্রতিবেদনে আরও আশ্চর্যজনক অভিজ্ঞতামূলক ফলাফলগুলির মধ্যে একটি মনোযোগ বা হোম অফিসের সাথে কিছুই করার নেই। বেশিরভাগ মাল্টিমোডাল LLM ভিশন এনকোডারের মতো কিমি K2.5 ভিশন এনকোডার একটি কনট্রাস্ট প্রাক-প্রশিক্ষিত মডেল (SigLIP) থেকে শুরু করা হয়েছে, এই ধারণার সাথে যে কনট্রাস্ট প্রাক-প্রশিক্ষণ এনকোডারকে কোনো ভাষা মডেলের সাথে সংযুক্ত হওয়ার আগে দরকারী ভিজ্যুয়াল ইঙ্গিত দেয়।
কিমি কে 3 ভিশন কোডার, MoonViT-V2প্রশিক্ষিত পরবর্তী টোকেন ভবিষ্যদ্বাণী ব্যবহার করে সম্পূর্ণরূপে স্ক্র্যাচ থেকে – কোন কন্ট্রাস্ট ফেজ একেবারে নেই. উল্লিখিত অনুপ্রেরণা হল প্রশিক্ষণের স্থিতিশীলতা: যখন একটি SigLIP বুটস্ট্র্যাপড এনকোডার LLM-এর সাথে সহ-অপ্টিমাইজ করা হয়, তখন গ্রেডিয়েন্টের নিয়মগুলি ক্রমশ বৃদ্ধি পায়, যখন স্ক্র্যাচ এনকোডারটি মসৃণভাবে ট্রেনিং করে। আরও আকর্ষণীয় অনুসন্ধান হল একটি ডাউনস্ট্রিম – মুনভিটি-ভি2 সমন্বয় SigLIP-এর দৃষ্টিভঙ্গি পরিমাপ জুড়ে প্রাথমিক বেসলাইন, যা লেখকরা প্রমাণ হিসাবে পড়েন যে কনট্রাস্ট প্রিট্রেনিং আসলে একটি শক্তিশালী LLM মাল্টিমোডাল ভিশন এনকোডারের জন্য একটি প্রয়োজনীয় উপাদান নয়, অন্তত এই স্কেলটিতে এবং পর্যাপ্ত এনটিপি-স্টাইল মাল্টিমোডাল ডেটা সহ।
আসল প্রবণতা: অবকাঠামো আর আলাদা স্তর নয়
এখানে সেই প্যাটার্ন যা সম্পূর্ণ রিপোর্টকে একত্রে বেঁধে রাখে, এবং এটি একই প্যাটার্ন যা DeepSeek V3 প্রথম স্পষ্ট করেছিল: সীমানা স্কেলে, পরিকাঠামো একটি নিরপেক্ষ প্ল্যাটফর্ম নয় যেটিতে আপনি একটি মডেল স্থাপন করেন — এটি অবশ্যই নির্দিষ্ট বাধাগুলির সাথে ডিজাইন করা উচিত যা আর্কিটেকচার তৈরি করে। DeepSeek V3 এর ডুয়ালপাইপ তৈরি করা হয়েছিল একটি যোগাযোগের ওভারহেড সমস্যা সমাধানের জন্য যার নিজস্ব MoE ডিজাইন দ্বারা তৈরি করা হয়েছে। কিমি কে 3 একই সময়ে বেশ কয়েকটি জায়গায় একই জিনিস করে:
- KDA এর ক্রমিক পুনরাবৃত্তি তিনি শুধুমাত্র আংশিকভাবে সমান্তরাল – খণ্ডের আকৃতিতে এখনও একটি সিরিয়াল খণ্ড ক্রস-নির্ভরতা রয়েছে যা রাষ্ট্রীয় প্রচারের সময় GPU SM কে সক্রিয় রাখে। কিমি K3 একটি ডেডিকেটেড CUTLASS ভিত্তিক কোরের সাথে এটি পরিচালনা করে, FlashKDAযা আন্তঃ-বিভাগ গণনাকে ক্রস-প্রচারের সাথে ওভারল্যাপ করে, পরিবর্তে দুটি পর্যায়কে বিকল্প এবং থামাতে দেয়।
- দীর্ঘ দূরত্ব যোগাযোগ: মূল-মান ব্লক প্রতিস্থাপনের পরিবর্তে যা ক্রম দৈর্ঘ্যের সাথে বৃদ্ধি পায় (যেমন সফটম্যাক্স-মনোযোগ প্রসঙ্গ সমান্তরাল করে), KDA প্রসঙ্গ সমান্তরালতা কেডিএ স্টেট নির্দিষ্ট আকারের, এবং প্রতিটি সেগমেন্টের প্রভাবকে স্থানীয়ভাবে গণনাযোগ্য ক্রমবর্ধমান ট্রানজিশন এবং স্থানীয়ভাবে উৎপন্ন অবস্থায় বিচ্যুত করে। ফলাফল হল যে র্যাঙ্ক জুড়ে মোড সিঙ্ক্রোনাইজেশনের জন্য শুধুমাত্র একটি প্রয়োজন সব-সংগ্রহ নির্দিষ্ট আকারক্রম দৈর্ঘ্য নির্বিশেষে – একটি যোগাযোগ প্রোফাইল একটি ব্লক ভিত্তিক প্রেক্ষাপটে এটি প্রসারিত সমান্তরাল তুলনায় অনেক সস্তা.
- বিশেষজ্ঞ সমান্তরাল লোড ব্যালেন্সিং: স্বাস্থ্য মন্ত্রণালয়ের পক্ষের প্রতিপক্ষ, মুনইপিলক্ষ্য নিখুঁত প্রচলিত EP স্কিমগুলি টেবিলে রেখে যাওয়া ভারসাম্যহীনতা ভোগ করার পরিবর্তে, গতিশীলভাবে নির্ধারিত অপ্রয়োজনীয় বিশেষজ্ঞদের ব্যবহার করে বিশেষজ্ঞদের সমান্তরাল স্তর জুড়ে ভারসাম্য বজায় রাখা – এমন একটি ভারসাম্যহীনতা যা বিশেষজ্ঞদের রুটেড পুল হাজার-বিশেষজ্ঞের সীমার দিকে বাড়ার সাথে সাথে আরও, কম নয়, ব্যয়বহুল হয়ে ওঠে।
- মেমরি ব্যবস্থাপনা: বেশিরভাগ সেশনের জন্য ব্লক FP8 কোয়ান্টাইজেশন, পাইপলাইন-সমান্তরাল স্তর জুড়ে সেশনের দূরবর্তী অফলোডিং (একীভূত 1F1B টাইমিং দ্বারা উত্পাদিত অসম সেশন বিতরণ সংশোধন করার জন্য), এবং Block AttnRes-এর জন্য একটি ডেডিকেটেড চেক কৌশল যাতে এর অতিরিক্ত লেয়ার রিডিং সেশন মেমরি বাজেটকে উড়িয়ে না দেয়।
সারাংশ
কিমি K3 শুধুমাত্র একটি বর্ধিত মডেল নয়। স্কেলিং প্রচেষ্টা নিজেই ইনফ্রা-পদ্ধতির সাথে গবেষণা ফলাফলের একটি সিরিজ যা স্কেলিংকে সম্ভব করেছে। এটি কয়েকটি জিনিস প্রমাণ করেছে:
- স্কেলিং আইনটি এখনও তার উপরের সিলিংয়ে পৌঁছেনি – তবে, স্কেলিং কৌশলটি স্কেলিং প্যারামিটারের চেয়ে বেশি গুরুত্বপূর্ণ
- রৈখিক মনোযোগ এর মূল্য প্রমাণ করেছে – কিমি K3 হল প্রথম এবং সর্ববৃহৎ পাবলিক মডেল যা বিশুদ্ধ রৈখিক মনোযোগ দিয়ে নির্মিত, যা ইঙ্গিত দিতে পারে যে আমরা একটি নতুন যুগে প্রবেশ করছি যেখানে সফটম্যাক্স মনোযোগ LLM ইকোসিস্টেমে প্রাধান্য পাবে না
- ইনফ্রারেড ক্ষমতা গবেষণায় এতটা গুরুত্বপূর্ণ ছিল না – তবে, এটি যে সমস্যার সমাধান করে তা গবেষণা ছাড়াই স্বাধীনভাবে বিদ্যমান নয়।
তথ্যসূত্র
- টিম কিমি, কিমি K3: ওপেন ফ্রন্টিয়ার ইন্টেলিজেন্সপ্রযুক্তিগত প্রতিবেদন, arXiv:2607.24653, 2026।
- টিম কিমি, কিমি লিনিয়ার: মনোযোগের একটি অভিব্যক্তিপূর্ণ এবং দক্ষ আর্কিটেকচার2025।
- ইয়াং এট আল।, গেটেড ডেল্টা নেটওয়ার্ক: ডেল্টা নিয়মের সাথে Mamba2 বর্ধনarXiv 2024।
- ডিপসিক-এআই, DeepSeek-V2: বিশেষজ্ঞ একীকরণের একটি শক্তিশালী, সাশ্রয়ী এবং দক্ষ ভাষা মডেলarXiv 2024।
- ডিপসিক-এআই, DeepSeek-V3 প্রযুক্তিগত প্রতিবেদনarXiv 2024।
- দাই এট আল।, DeepSeekMoE: বিশেষজ্ঞ ইন্টিগ্রেশন ল্যাঙ্গুয়েজ মডেলগুলিতে চূড়ান্ত বিশেষজ্ঞ বিশেষীকরণের দিকেarXiv 2024।
- টিম কিমি, কিমি কে 2: ওপেন এজেন্টিক বুদ্ধিমত্তাপ্রযুক্তিগত প্রতিবেদন, 2025।
টুওয়ার্ডস এআই এর মাধ্যমে পোস্ট করা হয়েছে