أغلى مورد في الذكاء الاصطناعي اليوم ليس قوة الحوسبة، بل عرض النطاق الترددي للذاكرة، وتُستنزف تقريباً كلها في تحريك شيء واحد: ذاكرة التخزين المؤقت KV. إصداران خلال الأشهر الأخيرة يهاجمان هذا الاختناق من اتجاهين هندسيين متعاكسين، V4.1-Flash من ديب سيك وHySparse2 من شياومي، ويشكّلان معاً صورة العصر القادم للاستدلال: وكلاء بمليون توكن تتسع في غيغابايت، لا تيرابايت.
1. أولاً، لنُقدّر حجم المشكلة
في طبقة الانتباه في المحوّل، يتطلب توليد توكن واحد قراءة متجهات المفاتيح/القيم لكل توكن سابق. مع انتباه كامل و61 طبقة (DeepSeek-V1) و128 رأس انتباه وبُعد رأس دقيق 128، تكلّف ذاكرة التخزين المؤقت لتوكن واحد بدقّة شبه خالية من الخسارة نحو 380 كيلوبايت عبر جميع الطبقات. نضرب في طول السياق:
- 32 ألف توكن: نحو 12 غيغابايت من ذاكرة KV
- 128 ألف توكن: نحو 49 غيغابايت
- مليون توكن: نحو 389 غيغابايت
الرقم الأخير هو سبب كون "سياق مليون توكن" تسويقاً حتى هذه السنة. إنها ليست مشكلة قدرة نموذج، بل مشكلة نظام ذاكرة: حتى مع عرض نطاق HBM يبلغ 8 تيرابايت/ثانية، فإن نقل 389 غيغابايت لكل توكن يحصرك في نحو 20 توكن/ثانية، قبل أي تفكير.
2. DeepSeek-V4.1-Flash: شفّر المخزون مرة واحدة وفعّل الكمّ بقوة
سلسلة ديب سيك تُسقط هذا الجدول:
آليتان تقومان بالعمل.
الترميز التزايدي KV. تعمل الطبقات السابقة في المكدّس بمثابة تسلسل هرمي للذاكرة: يُطبَّق الترميز على نافذة صغيرة أخيرة من الطبقات فقط، بدلاً من إعادة حساب المكدّس كاملاً لكل توكن. يُبنى السياق بـ"فرق" صغير لكل توكن، مع هياكل بيانات وصفية تفهرس ما سبق ترميزه، بحيث تُشفَّر تعليمات النظام المتكررة ومخرجات الأدوات المُعاد استخدامها مرة واحدة، لا في كل دورة.
ذاكرة KV بنمط FP4 (E2M1) مع بيانات وصفية FP8. أطلق V4-Flash ذاكرات KV بنمط FP8؛ ويذهب V4.1-Flash أبعد ليخزّن معظم المتجهات المخزّنة في كتل E2M1 بأسلوب NVFP4، ما يقلّص بصمة V4-Flash إلى النصف مجدداً. تبقى العناصر الحساسة أو عالية التكرار بدقّة أعلى، وهو الموضع الذي تُحفظ فيه أغلب جودة الاسترجاع.
النتيجة المركّبة أصغر بنحو 437 مرة من V1 و4 مرات من V4-Flash، وهذا ما يجعل سياق مليون توكن مجموعة عمل بحوالي 0.9 غيغابايت بدلاً من مركز بيانات صغير.
الهدف من كل هذا هو الوكلاء. المعايير ذاتية التصريح حيث يهيمن سياق الحِزام (تعليمات النظام + تعريفات أدوات MCP + الذاكرة) على استعلام المستخدم الفعلي هي بالضبط الحمل الذي تستهدفه الترميز التزايدي وإزالة التكرار بإعادة استخدام المخزون: جلسة الوكيل هي في أغلبها نص قالب يُرسَل مجدداً، وV4.1-Flash يتوقف عن الدفع مقابله مراراً.
3. HySparse2 من شياومي: لا تقرأ ما لن تستخدمه
بشكل منفصل، نشر مختبر الوكلاء في شياومي HySparse2 (arXiv 2609.26368)، وهي بنية انتباه متفرّق هجينة صُمّمت لنموذج وكيل MoE بحجم 80 مليار (نشّط A3B). حيث يقلّص ديب سيك المخزون لكل توكن، يقلّص HySparse2 ما يُقرأ لكل توكن. الآليات الأساسية:
- التفرّق المرن على مستوى الرأس. بدلاً من إعداد تفرّق عالمي واحد، يختار كل رأس توازنَه الخاص بين الانتباه المحلي بنافذة منزلقة واسترجاع دلالي من النمط top-K. يمكن لرؤوس الاحتفاظ أن تظل "ساخنة" بينما تتحول الرؤوس النحوية إلى المحلية غالباً.
- عدة ملفات تعريف. تمريرة صغيرة لتصنيف التوكّنات تُصنّفها إلى أدوار دلالية محلية مقابل عالمية، ثم تقسم تدفق KV إلى مسارات متوازية: مسار محلي كثيف دقيق ومسار عالمي خشن، لكل منهما سياسة خاصة.
- تمهيد top-K + محلي متداخل. أثناء معالجة التعليم، يتناوب الانتباه بين كتل عالمية لاختيار top-K وكتل نافذة محلية كثيفة، بحيث لا تُخرج الإصابات على مستوى الصفحة (مستودعات الكود، المستندات الطويلة) السياق المحلي الذي يستمر منه التوليد فعلياً.
- بيانات وصفية KV مختارة. فهرس مضغوط مخزّن منفصلاً فوق المخزون المكمَّم يقود الاسترجاع. يظهر تجريد شياومي أن الدقة على مجموعة وكلاء السياق الطويل لديها تنخفض من 27.32 إلى نحو دون/مع وجوده؛ مسار البيانات الوصفية هو ما يمنع ضمور الاسترجاع المتفرّق بصمت في استعلامات نمط الإبرة.
- KV مشترك بنمط MQA. يُنظَّم المخزون بنمط الاستعلام المجمَّع (بأسلوب MQA) (KV مشترك لكل طبقة عبر رؤوس الاستعلام)، ما يجعل مخزون الوكيل أصغر بنحو 4 إلى 4.5 مرة من تخطيط MLA القياسي بالعرض نفسه.
عند مليون توكن على نموذج 80 مليار مع KV بنمط FP8: يحافظ HySparse2 على 2.69 غيغابايت مقابل 6.72 لـHySparse و12.09 للانتباه الهجين بالنافذة المنزلقة، مع إنجاز حوسبة تمهيد أقل بـ5.02 مرة وحوسبة فكّ أقل بـ2.92 مرة من SWA الهجين. بحسب تقييمات استرجاع شياومي (بأسلوب RULER-v2 عند 32 ألف): 58.45 لـHySparse2 مقابل 35.74 لـHySparse و32.61 للنافذة المنزلقة.
ملاحظة صدق مهمة: ادعاءات شياومي بمليون توكن قائمة على حزام التقييم الخاص بها مقابل مجموعات استرجاع اصطناعية مثل متغيرات RedPajama؛ والتحقق المستقل من طرف ثالث من الاسترجاع الحقيقي عند مليون توكن ما زال ضعيفاً. البنية موثوقة؛ أما الأرقام النهائية فتستحق الشك المعتاد حتى تعيد فرق مستقلة إنتاجها عند أعماق تتجاوز 256 ألف.
4. هل تظهر المكاسب في معايير وكلاء حقيقية؟
ينشر ديب سيك مقارنات مباشرة لـV4.1-Flash بجهد استدلال كامل:
في هذا الجدول قصتان مختلفتان. في Terminal-Bench 2.1، وهو عملياً معيار الوكلاء القياسي الحالي للبرمجة/العمليات، يُقاس V4.1-Flash عند 90.6 متقدماً على Claude Opus 5 (89.1) وGPT-5.6 (88.8). أما في Terminal-Bench 4.0 الأصعب، فلا يزال Opus 5 متقدماً بوضوح (51.8 مقابل 31.2)، لذا ليس ادعاءً شاملاً بالهيمنة على الحدود التقنية. لكن الاتجاه لا لبس فيه: نموذج محسّن المخزون ومكمَّم بشدة أصبح الآن منافساً على المعايير التي تهم فعلاً من ينشر الوكلاء، لا فقط على أسئلة/أجوبة ثابتة.
5. ماذا يعني هذا إذا كنت تبني بالنماذج
- هندسة ذاكرة KV تصبح الحدود الحقيقية لتحسين الاستدلال. تُهيمن على تكلفة خدمة الوكيل تكلفة سياق الحِزام (تعليمات النظام + تعريفات أدوات MCP + الذاكرة)، والتي في تتبّع قِسته كانت 93 توكن سؤال مستخدم مقابل نحو 100 ألف توكن حمل زائد للحِزام لكل طلب. البنيات التي ترفض الدفع مقابل ذلك في كل دورة تغيّر الاقتصاديات الوحدوية بمراتب من الحجم.
- "النموذج الرخيص" لم يعد يعني "النموذج الغبي". الارتباط بين فئة سعر النموذج وموقعه في معايير الوكلاء ينكسر: V4.1-Flash يوضع في السعر أبعد بكثير تحت Opus 5 لكنه يقف تقريباً بمستواه في Terminal-Bench 2.1/DeepSWE/CyberGym.
- الانتباه المتفرّق انتقل من الورقة إلى الإنتاج. يُظهر HySparse2 الوصفة (مزيج تفرّق لكل رأس + اختيار متداخل + مخزون مكمَّم + بيانات استرجاع وصفية) التي ستصبح افتراضية في الجيل القادم من نماذج الوكلاء مفتوحة الأوزان. راقب أي المختبرات يتبنى المتغيرات أولاً.
- التحقق من السياق الطويل يجب أن يُكتسب بعد. ينبغي التعامل مع استرجاع مليون توكن المزعوم باعتباره ادعاءً بنيوياً لا مرساةً؛ طالب بإعادة إنتاج مستقلة عند 512 ألف فأكثر قبل بناء مسارات منتج تعتمد على استرجاع إبرة-داخل-مكدس-مليون.
إذا كانت السنوات الثلاث الماضية حول توسيع نطاق المعاملات، فتبدو السنوات الثلاث القادمة حول توسيع ما يتسع في الذاكرة لكل دولار. نشر ديب سيك وشياومي للتو أقوى دليل حتى الآن على أن هذه مشكلة هندسية قابلة للحل، وأن الفرق التي تعامل ذاكرة KV كنظام تخزين من الدرجة الأولى، لا كأثر جانبي للانتباه، هي التي ستضبط منحنى الأسعار الذي يتبعه الجميع.
المراجع
- Xiaomi AI (2026). "HySparse2: Hybrid Sparse Attention for Million-Token Agents." arXiv:2609.26368. الرابط: https://arxiv.org/abs/2609.26368
- ملاحظات شياومي الهندسية الأصلية عن HySparse2: https://originshq.com/blog/hysparse2-hybrid-sparse-attention-agents/ (تحليل ثانوي لعمليات الاستئصال في الورقة وأرقام ذاكرة KV عند مليون توكن)
- MindStudio (2026). "DeepSeek-V4.1-Flash KV Cache Compression." https://www.mindstudio.ai/blog/deepseek-v4-1-flash-kv-cache-compression
- NVIDIA (2024). "NVIDIA Blackwell Architecture Technical Brief: تكميم NVFP4 (E2M1)." https://resources.nvidia.com/en-us-blackwell-architecture
- فيديو الغلاف الأصلي: "DeepSeek's New Model vs Xiaomi's Sparse Attention" https://youtu.be/85QP5JDZfQM (الصورة المصغرة مستخدمة مع الإشارة إلى المصدر)