কিমি K3 প্রযুক্তিগত প্রতিবেদনের ভিতরে | AI এর দিকে

নেপাল বনাম নামিবিয়া


লেখক(গুলি): মেংলিউ ঝাও

মূলত টুওয়ার্ডস এআই-তে পোস্ট করা হয়েছে।

কিমি সিরিজের সর্বশেষ মডেল, K3, 2.8 ট্রিলিয়ন প্যারামিটারে উন্নীত হয়েছে। চিত্তাকর্ষক

মুনশট এআই-এর কিমি K3 প্রযুক্তিগত প্রতিবেদনটি এমন একটি মডেলের সাথে খোলে যা, কাগজে, কিমি K2–2.8T সামগ্রিক প্যারামিটার, 104B সক্ষম, 1M-টোকেন প্রসঙ্গ উইন্ডো এবং আসল দৃশ্যের আকারের প্রায় তিনগুণ। ক্ষতির তুলনা কিমি K2-এর তুলনায় 2.5X স্কেল দক্ষতা দেখায় – স্কেলিং আইন এখনও তার জায়গা আছে তার আরও প্রমাণ। যাইহোক, স্কেলিংয়ের আইনটি নিজেই “কী কাজ করে” এর প্রমাণ – তবে মৌলিক প্রশ্ন, “কীভাবে জিনিসগুলি কাজ করে”, রিপোর্টের আসল চাবিকাঠি।

এই নিবন্ধে, আমি চারটি স্থাপত্য ধারণার উপরে যাব যা কিমি কে 3 এর স্কেলকে অ্যাক্সেসযোগ্য করে তোলে:

  • মনোযোগের মূল আর্কিটেকচার: সঙ্গে রৈখিক মনোযোগ কিমি ডেল্টা মনোযোগ (KDA) চ এমএলএ বন্ধ NoPE সহ
  • অবশিষ্ট মনোযোগ গভীর জুড়ে
  • গোপন MoE পরিমাণ-ভিত্তিক লোড ব্যালেন্সিং সহ
  • এবং এছাড়াও একটি ভিশন টাওয়ার কোনো বৈসাদৃশ্যপূর্ণ প্রাক-প্রশিক্ষণ ছাড়াই প্রশিক্ষিত

এটি তখন অবকাঠামোর সহ-ডিজাইন দিয়ে বন্ধ হয়ে যায় যা এই সমস্ত কিছুর পাশাপাশি ঘটতে হয়েছিল, ডিপসিক V3 দিয়ে শুরু হওয়া একটি প্রবণতা অব্যাহত রেখে।

ছবির উৎস: https://tinyurl.com/mu6ezvf3। লেখক: জেটং লি

মনোযোগের মূল আর্কিটেকচার

মূল মনোযোগ স্তরটিতে 3টি কেডিএ স্তর + 1টি গেটেড এমএলএ স্তর রয়েছে, প্রতিটির পরে একটি স্থিতিশীল LatentMoE স্তর রয়েছে (যার বিষয়ে আমরা পরে কথা বলব)। প্রথমে আমরা কেডিএ স্তর ব্যাখ্যা করব।

কিমি ডেল্টা অ্যাটেনশন (কেডিএ)

কিমি K3 ডিফল্ট সিকোয়েন্স মিক্সার হিসাবে ক্লাসিক মাল্টি-হেড অ্যাটেনশন ব্যবহার করে না। পরিবর্তে, চারটি মনোযোগী স্তরের মধ্যে তিনটি কিমি ডেল্টা অ্যাটেনশন (কেডিএ)লিনিয়ার অ্যাটেনশন মেকানিজম প্রথমে কিমি লিনিয়ার (2025) এ প্রস্তাব করা হয়েছিল এবং সরাসরি উৎস করা হয়েছিল গেটেড ডেল্টানেট.

ডেল্টানেটের ধারণাটি সহজ: ভ্যানিলা লিনিয়ার অ্যাটেনশন ডিজাইনের কারণে সৃষ্ট নিম্ন কর্মক্ষমতা সমস্যা সমাধানের জন্য, লিনিয়ার রিগ্রেশন আপডেট করার জন্য একটি সাধারণ হোস্ট রূপান্তরের উপর ভিত্তি করে একটি ডেল্টা নিয়ম প্রস্তাব করা হয়েছিল:

DeltaNet আপডেট নিয়ম। সমীকরণের উৎস: https://arxiv.org/pdf/2510.26692

তারপর Gated DeltaNet শেখার প্রক্রিয়াকে আরও স্থিতিশীল করতে আরেকটি স্কেলার ভুলে গেট যোগ করেছে:

ডেল্টানেট গেটেড আপডেটের নিয়ম। সমীকরণের উৎস: https://arxiv.org/pdf/2510.26692

কি কিমি ডেল্টা অ্যাটেনশন (কেডিএ) ক্ষয়ের সূক্ষ্ম নিয়ন্ত্রণের জন্য তিনি একটি তির্যক গেট যোগ করেছেন:

কেডিএ আপডেটের নিয়ম। সমীকরণের উৎস: https://arxiv.org/pdf/2510.26692

কম্পিউটেশনাল দক্ষতা উন্নত করার জন্য, কেডিএ একটি পার্সিং-সমান্তরাল বিন্যাসে পুনরায় লেখা যেতে পারে (যা রৈখিক মনোযোগ গণনার জন্য একটি সাধারণ বিন্যাস)। সঠিক স্লাইডিং সমস্যা সমাধানের জন্য, ক্ষয় লগিটগুলিকে সম্পর্কিত করার জন্য একটি নেতিবাচক-সফটপ্লাস ম্যাপিং চালু করা হয়েছে।

কেডিএ থেকে সতর্ক থাকুন। ছবির উৎস: https://arxiv.org/pdf/2607.24653

গেটেড এমএলএ এবং নো পজিশন এনকোডিং (NoPE)

বদ্ধ মাথার মনোযোগ (এমএলএ) তিনি ক মনোযোগের সময়ে প্রতিটি মাথার জন্য পূর্বাভাস পুনর্নির্মাণের আগে একটি নিম্ন-র্যাঙ্ক শেয়ার্ড ল্যাটেন্টে কী এবং মান কম্প্রেস করে KV ক্যাশে সঙ্কুচিত করার জন্য DeepSeek-V2 প্রক্রিয়া চালু করা হয়েছে। যদিও ক্লাসিক এমএলএ অবস্থানগত তথ্য ইনজেক্ট করার জন্য RoPE প্রয়োগ করে, কিমি K3 এটি সম্পূর্ণভাবে ড্রপ করে – এর এমএলএ স্তরগুলি ব্যবহার করে NoPE (কোন অবস্থান এনকোডিং নেই). যুক্তিটি স্থাপত্যগত: কেডিএ স্তরগুলি ইতিমধ্যেই তাদের পুনরাবৃত্তিমূলক ক্ষয়ের মাধ্যমে অবস্থান-সংবেদনশীল, সাম্প্রতিক-কাল-সচেতন মিশ্রণ সরবরাহ করে, তাই এমএলএ স্তরগুলি তারা যা করতে পারে তা করার জন্য মুক্ত হয়। এটি একটি দীর্ঘ প্রসঙ্গে একটি খুব ব্যবহারিক মাথাব্যথাকেও বাইপাস করে: রিটিউন করার জন্য কোন ROPE ফ্রিকোয়েন্সি বেস নেই, প্রসঙ্গ দৈর্ঘ্য প্রসারিত করার সময় YaRN ইন্টারপোলেশনের প্রয়োজন নেইকারণ প্রথম স্থানে প্রতিস্থাপন করার জন্য কোন ঘূর্ণনগত এম্বেডিং নেই। এর উপরে, K3 এমএলএ-তে একটি পূর্ণ-স্কেল, ইনপুট-নির্ভর আউটপুট গেট যোগ করে (কেডিএ-তে একটি অনুরূপ গেটকে মিরর করে), প্রতিটি টোকেন বিশ্বব্যাপী মনোযোগ থেকে কোন চ্যানেলগুলি পড়তে পারে তা নিয়ন্ত্রণ করতে দেয়।

DeepSeek কাগজ বহু-মাথা গোপন মনোযোগ. ছবির উৎস: https://arxiv.org/html/2412.19437

অবশিষ্ট মনোযোগ: একটি ধারাবাহিকতা হিসাবে গভীরতা উপলব্ধি করা

এটি সম্ভবত প্রযুক্তিগত প্রতিবেদন দ্বারা প্রস্তাবিত সবচেয়ে আকর্ষণীয় ধারণাগুলির মধ্যে একটি: ট্রান্সফরমারগুলি মনোযোগের উপর অবিচ্ছিন্ন নির্ভরতাকে কীভাবে আচরণ করে তার অনুরূপ, অবশিষ্ট মনোযোগ মনোযোগ বিন্যাসে অবশিষ্ট গঠন করার চেষ্টা করা হচ্ছে:

গভীরতা এবং অবশিষ্টাংশের দ্বৈততা। সমীকরণের উৎস: https://arxiv.org/pdf/2603.15031

Kimi K3 আর্কিটেকচারে স্যুইচ করার সময়, এর অর্থ হল এক জোড়া স্তরের জন্য অবশিষ্টাংশ গণনা করা:

অবশিষ্ট মনোযোগ সম্পূর্ণ সংজ্ঞা. সমীকরণের উৎস: https://arxiv.org/pdf/2607.24653

মডেলের গভীরতা < 100 দেওয়া, সম্পূর্ণ গণনা খরচ হল O(L²d), যা এখনও যুক্তিসঙ্গত, এবং অবশিষ্টাংশ গণনা করা ব্লক শৈলী হলে তা হ্রাস করা যেতে পারে।

তাহলে কেন এই ধরনের একটি স্তর শৈলী মধ্যে অবশিষ্টাংশ যোগ করুন? কারণটি সহজ – কিমি কে 3 স্তরের সংখ্যা বাড়িয়ে 93 করেছে, কিমি কে 2 এর সাথে তুলনা করার সময় মাত্র 61টি স্তর রয়েছে৷ মডেল স্তরের 52% বৃদ্ধি গ্রেডিয়েন্ট ব্যাকপ্রোপাগেশনে একটি বিশাল বাধা সৃষ্টি করে – যা ক্লাসিক্যাল স্কিপ কাপলিং দ্বারা সমাধান করা যায় না, এবং একটি ঘন উপস্থাপনা প্রয়োজন।

সম্পূর্ণ মনোযোগের অবশিষ্ট উপস্থাপনা। ছবির উৎস: https://arxiv.org/pdf/2603.15031

স্থিতিশীল LatentMoE: ভারসাম্য না হারিয়ে ~1,000 বিশেষজ্ঞদের স্কেল করুন

Kimi K3 তার MoE আর্কিটেকচারে বিশেষজ্ঞদের সংখ্যাকে আরও অনেক বেশি এগিয়ে দেয় – 896 রাউটেড বিশেষজ্ঞ প্রতি টোকেনে 16 সক্রিয় (K2 এর 384 রাউটেড / 8 সক্রিয়ের তুলনায়) – এবং স্পারসিটিতে অতিরিক্ত 133% লাফ দুটি জিনিস ভেঙে দেয় যা আগে একটি ছোট স্কেলে ভাল কাজ করেছিল।

স্থাপত্য ফিক্স হয় LatentMoE: ভাগ করা বিশেষজ্ঞরা এখনও মডেলের সম্পূর্ণ লুকানো প্রস্থে কাজ করে, কিন্তু রাউট করা বিশেষজ্ঞরা অনেক বেশি সংকীর্ণ লুকানো জায়গায় কাজ করে, লঞ্চের আগে নিম্নগামী অভিক্ষেপ এবং একত্রিত হওয়ার পরে ঊর্ধ্বমুখী অভিক্ষেপের মাধ্যমে পৌঁছায়। এটি সম্পূর্ণ মডেল প্রস্থ থেকে রাউটারের খরচকে দ্বিগুণ করে, যা টোকেন প্রতি 896 বিশেষজ্ঞের মধ্যে 16 জনকে সবচেয়ে সার্থক করে তোলে।

তবে স্থিতিশীলতার সমস্যা রয়ে গেছে। Kimi K3 এই দুটি পদ্ধতির সম্বোধন করে: ক) প্রজেকশন আপ + নতুন অ্যাক্টিভেশন ফাংশনের আগে RMMSMorm সহ, সিটু-গ্লু (Sigmoid Tanh Unit GLU), যা একটি SwiGLU-শৈলীর গেটের উভয় শাখাকে স্কেল করা Tanh-এ কভার করে – যখন SwiGLU ভালভাবে কাজ করে, যা আউটপুটকে আবদ্ধ করে যাতে বড় আকারের স্থানাঙ্কগুলি কম নির্ভুলতায় বিস্ফোরিত না হতে পারে; আমি) পরিমাণগত ভারসাম্য: সরাসরি বিশেষজ্ঞের পক্ষপাতকে স্কোর কোয়ান্টাইলে সেট করে যা সেই বিশেষজ্ঞকে তার সাথে প্রদান করবে লক্ষ্য লোড, রাউটিং মার্জিনের হিস্টোগ্রাম থেকে প্রতিটি প্রশিক্ষণের ধাপের জন্য অনুমান করা হয় (একটি সঠিক পরিমাণের জন্য লক্ষ লক্ষ পৃথক মান সংগ্রহ করা এড়াতে)।

ভাগ করা এবং রাউট করা MoE ডিজাইন। ছবির উৎস: https://arxiv.org/pdf/2607.24653

একজন দৃষ্টি উৎপাদনকারী যার বিপরীত প্রাক-প্রশিক্ষণের প্রয়োজন নেই

প্রতিবেদনে আরও আশ্চর্যজনক অভিজ্ঞতামূলক ফলাফলগুলির মধ্যে একটি মনোযোগ বা হোম অফিসের সাথে কিছুই করার নেই। বেশিরভাগ মাল্টিমোডাল LLM ভিশন এনকোডারের মতো কিমি K2.5 ভিশন এনকোডার একটি কনট্রাস্ট প্রাক-প্রশিক্ষিত মডেল (SigLIP) থেকে শুরু করা হয়েছে, এই ধারণার সাথে যে কনট্রাস্ট প্রাক-প্রশিক্ষণ এনকোডারকে কোনো ভাষা মডেলের সাথে সংযুক্ত হওয়ার আগে দরকারী ভিজ্যুয়াল ইঙ্গিত দেয়।

কিমি কে 3 ভিশন কোডার, MoonViT-V2প্রশিক্ষিত পরবর্তী টোকেন ভবিষ্যদ্বাণী ব্যবহার করে সম্পূর্ণরূপে স্ক্র্যাচ থেকে – কোন কন্ট্রাস্ট ফেজ একেবারে নেই. উল্লিখিত অনুপ্রেরণা হল প্রশিক্ষণের স্থিতিশীলতা: যখন একটি SigLIP বুটস্ট্র্যাপড এনকোডার LLM-এর সাথে সহ-অপ্টিমাইজ করা হয়, তখন গ্রেডিয়েন্টের নিয়মগুলি ক্রমশ বৃদ্ধি পায়, যখন স্ক্র্যাচ এনকোডারটি মসৃণভাবে ট্রেনিং করে। আরও আকর্ষণীয় অনুসন্ধান হল একটি ডাউনস্ট্রিম – মুনভিটি-ভি2 সমন্বয় SigLIP-এর দৃষ্টিভঙ্গি পরিমাপ জুড়ে প্রাথমিক বেসলাইন, যা লেখকরা প্রমাণ হিসাবে পড়েন যে কনট্রাস্ট প্রিট্রেনিং আসলে একটি শক্তিশালী LLM মাল্টিমোডাল ভিশন এনকোডারের জন্য একটি প্রয়োজনীয় উপাদান নয়, অন্তত এই স্কেলটিতে এবং পর্যাপ্ত এনটিপি-স্টাইল মাল্টিমোডাল ডেটা সহ।

সামগ্রিক মডেল ডিজাইন। ছবির উৎস: https://arxiv.org/pdf/2607.24653

আসল প্রবণতা: অবকাঠামো আর আলাদা স্তর নয়

এখানে সেই প্যাটার্ন যা সম্পূর্ণ রিপোর্টকে একত্রে বেঁধে রাখে, এবং এটি একই প্যাটার্ন যা DeepSeek V3 প্রথম স্পষ্ট করেছিল: সীমানা স্কেলে, পরিকাঠামো একটি নিরপেক্ষ প্ল্যাটফর্ম নয় যেটিতে আপনি একটি মডেল স্থাপন করেন — এটি অবশ্যই নির্দিষ্ট বাধাগুলির সাথে ডিজাইন করা উচিত যা আর্কিটেকচার তৈরি করে। DeepSeek V3 এর ডুয়ালপাইপ তৈরি করা হয়েছিল একটি যোগাযোগের ওভারহেড সমস্যা সমাধানের জন্য যার নিজস্ব MoE ডিজাইন দ্বারা তৈরি করা হয়েছে। কিমি কে 3 একই সময়ে বেশ কয়েকটি জায়গায় একই জিনিস করে:

  • KDA এর ক্রমিক পুনরাবৃত্তি তিনি শুধুমাত্র আংশিকভাবে সমান্তরাল – খণ্ডের আকৃতিতে এখনও একটি সিরিয়াল খণ্ড ক্রস-নির্ভরতা রয়েছে যা রাষ্ট্রীয় প্রচারের সময় GPU SM কে সক্রিয় রাখে। কিমি K3 একটি ডেডিকেটেড CUTLASS ভিত্তিক কোরের সাথে এটি পরিচালনা করে, FlashKDAযা আন্তঃ-বিভাগ গণনাকে ক্রস-প্রচারের সাথে ওভারল্যাপ করে, পরিবর্তে দুটি পর্যায়কে বিকল্প এবং থামাতে দেয়।
  • দীর্ঘ দূরত্ব যোগাযোগ: মূল-মান ব্লক প্রতিস্থাপনের পরিবর্তে যা ক্রম দৈর্ঘ্যের সাথে বৃদ্ধি পায় (যেমন সফটম্যাক্স-মনোযোগ প্রসঙ্গ সমান্তরাল করে), KDA প্রসঙ্গ সমান্তরালতা কেডিএ স্টেট নির্দিষ্ট আকারের, এবং প্রতিটি সেগমেন্টের প্রভাবকে স্থানীয়ভাবে গণনাযোগ্য ক্রমবর্ধমান ট্রানজিশন এবং স্থানীয়ভাবে উৎপন্ন অবস্থায় বিচ্যুত করে। ফলাফল হল যে র‌্যাঙ্ক জুড়ে মোড সিঙ্ক্রোনাইজেশনের জন্য শুধুমাত্র একটি প্রয়োজন সব-সংগ্রহ নির্দিষ্ট আকারক্রম দৈর্ঘ্য নির্বিশেষে – একটি যোগাযোগ প্রোফাইল একটি ব্লক ভিত্তিক প্রেক্ষাপটে এটি প্রসারিত সমান্তরাল তুলনায় অনেক সস্তা.
  • বিশেষজ্ঞ সমান্তরাল লোড ব্যালেন্সিং: স্বাস্থ্য মন্ত্রণালয়ের পক্ষের প্রতিপক্ষ, মুনইপিলক্ষ্য নিখুঁত প্রচলিত EP স্কিমগুলি টেবিলে রেখে যাওয়া ভারসাম্যহীনতা ভোগ করার পরিবর্তে, গতিশীলভাবে নির্ধারিত অপ্রয়োজনীয় বিশেষজ্ঞদের ব্যবহার করে বিশেষজ্ঞদের সমান্তরাল স্তর জুড়ে ভারসাম্য বজায় রাখা – এমন একটি ভারসাম্যহীনতা যা বিশেষজ্ঞদের রুটেড পুল হাজার-বিশেষজ্ঞের সীমার দিকে বাড়ার সাথে সাথে আরও, কম নয়, ব্যয়বহুল হয়ে ওঠে।
  • মেমরি ব্যবস্থাপনা: বেশিরভাগ সেশনের জন্য ব্লক FP8 কোয়ান্টাইজেশন, পাইপলাইন-সমান্তরাল স্তর জুড়ে সেশনের দূরবর্তী অফলোডিং (একীভূত 1F1B টাইমিং দ্বারা উত্পাদিত অসম সেশন বিতরণ সংশোধন করার জন্য), এবং Block AttnRes-এর জন্য একটি ডেডিকেটেড চেক কৌশল যাতে এর অতিরিক্ত লেয়ার রিডিং সেশন মেমরি বাজেটকে উড়িয়ে না দেয়।

সারাংশ

কিমি K3 শুধুমাত্র একটি বর্ধিত মডেল নয়। স্কেলিং প্রচেষ্টা নিজেই ইনফ্রা-পদ্ধতির সাথে গবেষণা ফলাফলের একটি সিরিজ যা স্কেলিংকে সম্ভব করেছে। এটি কয়েকটি জিনিস প্রমাণ করেছে:

  • স্কেলিং আইনটি এখনও তার উপরের সিলিংয়ে পৌঁছেনি – তবে, স্কেলিং কৌশলটি স্কেলিং প্যারামিটারের চেয়ে বেশি গুরুত্বপূর্ণ
  • রৈখিক মনোযোগ এর মূল্য প্রমাণ করেছে – কিমি K3 হল প্রথম এবং সর্ববৃহৎ পাবলিক মডেল যা বিশুদ্ধ রৈখিক মনোযোগ দিয়ে নির্মিত, যা ইঙ্গিত দিতে পারে যে আমরা একটি নতুন যুগে প্রবেশ করছি যেখানে সফটম্যাক্স মনোযোগ LLM ইকোসিস্টেমে প্রাধান্য পাবে না
  • ইনফ্রারেড ক্ষমতা গবেষণায় এতটা গুরুত্বপূর্ণ ছিল না – তবে, এটি যে সমস্যার সমাধান করে তা গবেষণা ছাড়াই স্বাধীনভাবে বিদ্যমান নয়।

তথ্যসূত্র

  • টিম কিমি, কিমি K3: ওপেন ফ্রন্টিয়ার ইন্টেলিজেন্সপ্রযুক্তিগত প্রতিবেদন, arXiv:2607.24653, 2026।
  • টিম কিমি, কিমি লিনিয়ার: মনোযোগের একটি অভিব্যক্তিপূর্ণ এবং দক্ষ আর্কিটেকচার2025।
  • ইয়াং এট আল।, গেটেড ডেল্টা নেটওয়ার্ক: ডেল্টা নিয়মের সাথে Mamba2 বর্ধনarXiv 2024।
  • ডিপসিক-এআই, DeepSeek-V2: বিশেষজ্ঞ একীকরণের একটি শক্তিশালী, সাশ্রয়ী এবং দক্ষ ভাষা মডেলarXiv 2024।
  • ডিপসিক-এআই, DeepSeek-V3 প্রযুক্তিগত প্রতিবেদনarXiv 2024।
  • দাই এট আল।, DeepSeekMoE: বিশেষজ্ঞ ইন্টিগ্রেশন ল্যাঙ্গুয়েজ মডেলগুলিতে চূড়ান্ত বিশেষজ্ঞ বিশেষীকরণের দিকেarXiv 2024।
  • টিম কিমি, কিমি কে 2: ওপেন এজেন্টিক বুদ্ধিমত্তাপ্রযুক্তিগত প্রতিবেদন, 2025।

টুওয়ার্ডস এআই এর মাধ্যমে পোস্ট করা হয়েছে



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *