Loading blog posts...
Loading blog posts...
جاري التحميل...

الادعاء الرئيسي خاطئ، والبيانات التي تدحضه أكثر إثارة من الادعاء نفسه. Kimi K3 هو أكبر نموذج مفتوح الأوزان (open-weight) صدر حتى الآن بـ 2.8 تريليون معامل، ومع ذلك يحتل المركز الرابع فقط بين النماذج الأكثر تطوراً. ما تفوقت فيه النماذج المفتوحة فعلاً خلال 2026 هو حجم الـ tokens، لا القدرات. هذان مقياسان مختلفان تماماً.
على مؤشر Artificial Analysis Intelligence Index، حصل K3 على 57 نقطة. بينما سجّل Claude Fable 5 من Anthropic نقطة 60. أما GPT-5.6 Sol من OpenAI فحصل على 59. يتفوق K3 بفارق ضئيل على Claude Opus 4.8، وهذا كل الفارق (مقارنة Codersera المعيارية).
لا تنكر Moonshot AI هذه الحقيقة. بل تعترف في منشور الإطلاق الخاص بها أن K3 يأتي خلف النموذجين الأمريكيين الرائدين من حيث القدرات العامة (مدونة Moonshot AI التقنية). هذا الاعتراف مهم، لأن معظم التغطيات التي تدّعي عكس ذلك تستند إلى أرقام مقارنة قدمتها الشركة المصنّعة نفسها، ولم يُثبتها أحد بشكل مستقل.
الجانب الذي يتفوق فيه K3 محدود ومحصور. فهو يتصدر Frontend Code Arena بـ 1,679 نقطة مقابل 1,631 لـ Fable 5، ويتعادل مع GPT-5.6 على مؤشر Coding Agent Index بـ 57 نقطة، ويقود SWE Marathon بـ 42.0، ويتفوق على Fable 5 في Terminal Bench 2.1 (88.3 مقابل 84.6). أما على GDPval v2، وهو أوسع معيار لتقييم المهام الواقعية، فيحتل المركز الثاني بوضوح.
لماذا هذا مهم: K3 هو أفضل نموذج مفتوح الأوزان موجود حالياً، والرائد في فئة وكلاء البرمجة (coding agents). لكن هذا لا يجعله أفضل نموذج على الإطلاق.
هذه هي القصة الحقيقية، وهي تتشكل منذ عام كامل. تراجعت حصة النماذج ذات المنشأ الأمريكي (OpenAI وAnthropic وGoogle) من نحو 70% من حركة tokens على منصة OpenRouter في يونيو 2025 إلى حوالي 30% بحلول منتصف 2026. في المقابل، بلغت النماذج ذات المنشأ الصيني 61% من إجمالي استهلاك الـ tokens بحلول فبراير 2026، ووصلت في ذروتها إلى نحو 46% من حجم tokens المؤسسات الأمريكية (تحليل FourWeekMBA لبيانات OpenRouter).
نما إجمالي إنتاجية المنصة من حوالي 5 تريليون token أسبوعياً في أبريل 2025 إلى أكثر من 20 تريليون بحلول أبريل 2026. تتصدر DeepSeek جميع مزودي الخدمة من حيث عدد الـ tokens الخام. هذا يعني توسعاً في السوق بمقدار أربعة أضعاف، ذهب الجزء الأكبر من الزيادة فيه إلى النماذج المفتوحة. ليس لأن النماذج المفتوحة أصبحت أفضل من المغلقة، بل لأنها أصبحت جيدة بما يكفي بسعر غيّر معادلة الجدوى الاقتصادية لأنواع كثيرة من الأحمال.
لماذا هذا مهم: فازت النماذج المفتوحة بالأحمال التي تحدد فيها تكلفة الـ token بنية النظام، وهي غالبية الأحمال.

تمتلك Anthropic حصة تتراوح بين 12 و13% تقريباً من tokens منصة OpenRouter، لكنها تستحوذ على شريحة أكبر بكثير من الإيرادات. نموذج بسعر 0.09 دولار لكل مليون token يمكن أن يسيطر على عدد الـ tokens، بينما يسيطر نموذج آخر بسعر 5 دولارات لكل مليون على الفواتير.
هذا الانقسام هو ما تختزله تقريباً كل مقالة تدّعي أن "المفتوح تفوق على المغلق" في رقم واحد فقط. حصة الـ tokens تقيس أين تُنفَّذ الأعمال الرخيصة عالية الحجم: التصنيف، الاستخراج، التلخيص، إعادة ترتيب نتائج البحث. أما حصة الإيرادات فتقيس أين تُنفَّذ الأعمال عالية المخاطر: المهام الوكيلة طويلة الأمد (agentic tasks)، مراجعة الكود في أنظمة الإنتاج، وأي مهمة تكون فيها الإجابة الخاطئة أغلى من كلفة الاستدلال نفسه.
Important
عند تقييم أي ادعاء بأن "النماذج المفتوحة تفوز" في 2026، اسأل نفسك: أي لوحة نتائج يستشهد بها؟ الحجم والقدرة والإيرادات تتحرك كلها في اتجاهات مختلفة، ومخطط واحد يُظهر أحدها لا يخبرك شيئاً عن الاثنين الآخرين.
لماذا هذا مهم: حصلت النماذج المفتوحة على عدد الـ tokens. أما المختبرات المغلقة فاحتفظت بهامش الربح، والهامش هو ما يموّل جولة التدريب التالية.
هنا تأتي النتيجة التي يجب أن تنهي سردية "التفوق" نهائياً. منذ يناير 2026، تتخلف أفضل النماذج المفتوحة عن النماذج المغلقة الرائدة بمعدل أربعة أشهر، أي ما يعادل 8 نقاط على مؤشر ECI. في الفترة من يناير 2023 حتى أكتوبر 2025، كانت هذه الفجوة نحو ثلاثة أشهر فقط. وبموجب قواعد مقارنة أكثر صرامة، تتمدد الفجوة الحالية إلى ستة أشهر (Epoch AI).
اتسعت الفجوة بدلاً من أن تضيق، في نفس العام الذي أعلن فيه الجميع أنها أُغلقت. تعزو Epoch ذلك إلى فارق متزايد في الاستثمار في الحوسبة. كما تشير إلى مشكلة قياس يجب الانتباه لها: قد تُظهر المعايير العامة (public benchmarks) النماذج المفتوحة بصورة أفضل مما هي عليه فعلاً، لأن مجموعات الاختبار العامة أسهل في التحسين مقابلها من مجموعات التقييم الخاصة غير المكشوفة (تقرير Epoch AI عن النماذج المفتوحة).
لماذا هذا مهم: إذا كانت إصدارات النماذج المفتوحة تبدو أقرب من الرائدة مما هي عليه واقعياً، فإن قرارات الشراء المبنية على المعايير المرجعية منحازة بشكل منهجي لصالح النماذج المفتوحة.
عدد المعاملات مجرد رقم إعلاني. الهندسة الحقيقية تكمن في التخفيف (sparsity). يفعّل K3 خبيراً واحداً من كل 56 خبيراً (16 من أصل 896) لكل token، وذلك ضمن بنية أطلقت عليها Moonshot اسم Stable LatentMoE. يعتمد توزيع الخبراء على تقنية Quantile Balancing، التي تستنبط التوجيه من نسب مئوية لدرجات الموجّه (router-score quantiles) بدلاً من معامل توازن حمل مضبوط يدوياً. هذا يزيل واحداً من أكثر المعاملات الفائقة هشاشة في تدريب نماذج MoE الكبيرة. تدّعي Moonshot أن كفاءة التوسع تحسّنت بمقدار 2.5 ضعف مقارنة بـ K2.
تشغيل نموذج بحجم 2.8 تريليون معامل أصلاً يعتمد على تدريب واعٍ للتكميم (quantization-aware training) يبدأ من مرحلة الضبط الدقيق الموجَّه (SFT) ويستمر بعدها، باستخدام أوزان MXFP4 وتفعيلات MXFP8. هذا يقلص متطلبات عرض النطاق الترددي للذاكرة بنحو 4 أضعاف مقارنة بـ FP16 (Tom's Hardware).
ومن بين مواصفات أخرى: تعدد وسائط أصلي (native multimodality)، ونافذة سياق تصل إلى مليون token، واستدلال (reasoning) مفعّل دائماً بلا خيار للإيقاف.
لماذا هذا مهم: الادعاء المثير للاهتمام ليس 2.8 تريليون معامل. بل أن التدريب الواعي للتكميم بدءاً من مرحلة SFT جعل نموذجاً بهذا الحجم قابلاً للتشغيل بتكلفة تنافسية لكل مهمة.

تقدير تقريبي بدقة 4-bit لأوزان النموذج فقط يضع K3 عند حاجة تصل إلى نحو 1.4 تيرابايت من ذاكرة VRAM. بطاقة RTX 4090 تحمل 24 جيجابايت فقط. أربع بطاقات H100 بسعة 80 جيجابايت تمنحك 320 جيجابايت، وهذا يكفي فقط لتحميل النموذج بدقة منخفضة، مع سياق مختصر إلى 128K-256K token وأداء متدهور بوضوح. أما توجيهات Moonshot الرسمية فتشير إلى إعدادات "supernode" تضم 64 معالجاً متسارعاً أو أكثر. لم تُنشر بعد أي مواصفات دنيا رسمية لتشغيل النموذج.
| الإعداد | إجمالي VRAM | هل يمكن تشغيل K3؟ |
|---|---|---|
| RTX 4090 | 24 جيجابايت | لا |
| 4x H100 80GB | 320 جيجابايت | دقة متدهورة، سياق 128K-256K |
| Supernode الموصى به من Moonshot | 64+ معالجاً | نعم، بسياق كامل |
| تقدير الأوزان فقط بدقة 4-bit | ~1.4 تيرابايت مطلوب | رقم مرجعي |
Warning
"الأوزان المفتوحة" و"إمكانية التشغيل الذاتي" توقفتا عن أن تكونا الشيء ذاته عند حدود التريليون معامل تقريباً. بالنسبة لـ K3، تعني الأوزان المفتوحة أن مزودي الحوسبة السحابية والمؤسسات الغنية بالتمويل يمكنها استضافة النموذج ذاتياً. أما الهواة فلا يستطيعون ذلك، ولا يوجد مقدار من التكميم يحل مشكلة بصمة 1.4 تيرابايت على عتاد استهلاكي عادي.
القراءة الاستراتيجية: تتحول الأوزان المفتوحة إلى نقطة تحكم في الاستدلال (inference control point) بدلاً من كونها آلية لديمقراطية التقنية. إطلاق أوزان لا يستطيع تشغيلها أحد خارج مركز بيانات ينقل المنافسة إلى من يملك البنية التحتية، لا من يملك النموذج.
لماذا هذا مهم: توفر الأوزان لم يعد يعني استقلالية عملية عن مزودي الحوسبة السحابية.
تسعير K3 هو أوضح إشارة أرسلتها Moonshot حول كيفية نظرتها لموقعها في السوق.
| النموذج | الإدخال (بدون تخزين مؤقت) | الإدخال (مع تخزين مؤقت) | الإخراج |
|---|---|---|---|
| Kimi K2.6 | 0.95$/M | - | 4$/M |
| Kimi K3 | 3.00$/M | 0.30$/M | 15$/M |
| Claude Sonnet 5 | فئة مماثلة | - | فئة مماثلة |
هذه زيادة سعرية جيلية بمقدار 3 إلى 4 أضعاف، تضع K3 في نفس مستوى Claude Sonnet 5 (The Decoder). تبلغ تكلفة المهمة الواحدة نحو 0.94 دولار، وهو رقم مقارب لـ GPT-5.6 Sol ويعادل تقريباً نصف تكلفة Opus 4.8. لذلك يبقى K3 تنافسياً من حيث الإنفاق الإجمالي. لكنه ببساطة لم يعد خياراً اقتصادياً رخيصاً. تسعّر Moonshot نموذجها بناءً على القدرة، وهذا ما تفعله أي مختبر عندما يعتقد أن نموذجه يستحق هذا السعر.
الرقم الذي يجب التخطيط حوله هو سعر الإدخال المخزن مؤقتاً: 0.30 دولار لكل مليون. الفارق الذي يصل إلى 10 أضعاف بين إصابة التخزين المؤقت وعدم إصابته يعني أن بنية الـ prompt، لا اختيار النموذج، هي المتغير الأهم في التكلفة للاستدعاءات الوكيلة المتكررة.
لماذا هذا مهم: فرصة التحكيم السعري (pricing arbitrage) التي دفعت باعتماد النماذج الصينية على OpenRouter بدأت تنغلق في الفئة الرائدة، رغم استمرارها في الطبقات الأقل من السوق.
اختبارات Simon Willison العملية قدّمت أفضل بيانات أولية متاحة قبل نزول الأوزان الكاملة. في طلب واحد فقط، استهلك K3 13,241 token للاستدلال لإنتاج 3,417 token فقط كإخراج. هذه نسبة 3.9 ضعف، وتكلف نحو 25 سنتاً للطلب الواحد (Simon Willison).
يعني الاستدلال المفعّل دائماً أنه لا يوجد خيار لإيقافه. وبسعر 15 دولاراً لكل مليون token إخراج، مع احتساب tokens الاستدلال بنفس سعر الإخراج، فإن نسبة 3.9 ضعف تغيّر اقتصاديات الوحدة لأي تطبيق عالي الحجم.
كما اكتشف Willison رسالة نظام خفية (hidden system prompt) بطول 85 token تقريباً، وأشاد بقدرات الرؤية: كتب النموذج نصاً بديلاً (alt text) دقيقاً يصف صورة أنتجها هو نفسه.
تحذيره الأوسع يستحق اهتماماً أكبر من جداول المعايير المرجعية. المعايير غير الرسمية تبتعد تدريجياً عما يهم فعلاً في الإنتاج: موثوقية استدعاء الأدوات الوكيلة (agentic tool-calling) عبر محادثات طويلة. هذا ما تصطدم به الفرق في الأسبوع الثالث من أي عملية نشر، ولا توجد لوحة نتائج تقيسه بشكل جيد. يشرح دليلنا لبناء رادار أخبار الذكاء الاصطناعي كيفية تتبع اختبارات أولية كهذه بدلاً من الاعتماد على البيانات الصحفية فقط.
لماذا هذا مهم: عبء tokens الاستدلال الذي يقارب 4 أضعاف بند ميزانية حقيقي، وليس مجرد هامش ملاحظة.

هناك ثلاثة ادعاءات تنتشر هذا الأسبوع لا ينبغي تقديمها على أنها حقائق مؤكدة.
التقرير القائل بأن K3 "صمم شريحة إلكترونية خلال 48 ساعة" بمعدل "أكثر من 8,700 token في الثانية" يخلط بين تجربة توضيحية للمساعدة في التصميم ورقم يخص إنتاجية الاستدلال. الرقمان مأخوذان من سياقين مختلفين، والادعاء المدمج بينهما غير موثّق.
الانتصارات المباشرة على GPT-5.6 Sol وFable 5، بما فيها رقم "خمسة من ستة معايير وكيلة"، مصدرها الأساسي الشركة نفسها. Moonshot هي من أجرت هذه الاختبارات.
ثم هناك الإطار الإعلامي نفسه. تصف Bloomberg وFortune K3 بأنه يقلّص الفجوة مع الصين، وهذا وصف يمكن الدفاع عنه. بينما تنقل Axios وBusiness Insider قلقاً حقيقياً في وادي السيليكون وواشنطن، وهو أمر واقعي ويستحق التغطية. لكن القلق هو القصة، وليس "الانتصار". الأثر المحتمل التالي هو تحرك في سياسات ضوابط التصدير والأوزان المفتوحة، وهو ما يرتبط مباشرة بـنقاش حظر الذكاء الاصطناعي مفتوح المصدر من وقت سابق هذا الشهر.
لماذا هذا مهم: الفجوة بين ما تُظهره البيانات وما توحي به التغطية الإعلامية هي بالضبط حيث تُتخذ قرارات الشراء الخاطئة.
ابدأ من هنا راجع إنفاقك على نماذج اللغة الكبيرة خلال آخر 30 يوماً، وقسّمه إلى فئتين: استدعاءات عالية الحجم منخفضة المخاطر، واستدعاءات منخفضة الحجم عالية المخاطر. هذا التقسيم، لا جدول المعايير المرجعية، هو ما يخبرك إن كان K3 مناسباً لبنيتك التقنية.
مكاسب سريعة
تعمّق أكثر
ثلاث لوحات نتائج، وثلاثة فائزين مختلفين. فازت النماذج المفتوحة بالحجم بشكل حاسم. أما النماذج المغلقة فاحتفظت بالقدرة، بل وسّعت الفجوة في 2026 حسب Epoch. والمختبرات المغلقة احتفظت بالإيرادات التي تموّل دورة الحوسبة التالية.
Kimi K3 إنجاز حقيقي: أكبر نموذج مفتوح الأوزان صدر حتى الآن، وأفضل نموذج مفتوح متاح، والرائد في فئة وكلاء البرمجة. لكنه ليس أفضل نموذج على الإطلاق، والمختبر الذي طوّره يقول ذلك بنفسه.
27 يوليو هو الموعد المهم. حتى تنزل الأوزان والتقرير التقني، تبقى كل المعايير المتداولة إما مقدَّمة من الشركة نفسها أو مستمدة من عدد محدود من الاختبارات الأولية. إذا كان فريقك يتخذ قرارات بنيوية هذا الأسبوع، فانتظر عشرة أيام أخرى.
بالنسبة للمؤسسات التي تحاول معرفة أين تندرج النماذج مفتوحة الأوزان إلى جانب واجهات API المغلقة ضمن بنية إنتاجية، تبني Joulyan IT أنظمة تكامل وأتمتة للذكاء الاصطناعي مصمَّمة حول هذا التوازن بين التكلفة والقدرة، لا حول أي نموذج تصدّر لوحة النتائج الأسبوع الماضي.