Loading blog posts...
Loading blog posts...
جاري التحميل...

يتساوى الآن Claude Sonnet 5.5 وGPT-6.1 Sol في السعر: $2 للإدخال و$10 للإخراج. ومع انخفاض تكلفة القدرات القريبة من مستوى النماذج الرائدة، أصبحت قرارات الشراء تعتمد على توافق الأدوات، وإمكانية نشر النماذج مفتوحة الأوزان، ومستوى التحكم التشغيلي.
ملخص سريع
أطلقت Anthropic نموذج Claude Sonnet 5.5 في 28 سبتمبر، ثم أطلقت OpenAI نموذج GPT-6.1 Sol خلال DevDay في 29 سبتمبر. يتساوى النموذجان في الأسعار القياسية، لكن طريقة عمل API لكل منهما تختلف بما يكفي لجعل الانتقال بينهما بناءً على نتائج الاختبارات فقط قراراً غير مدروس.
| النموذج | تاريخ الإصدار | الإدخال لكل مليون token | الإخراج لكل مليون token | الفارق التشغيلي |
|---|---|---|---|---|
| Claude Sonnet 5.5 | 28 سبتمبر | $2.00 | $10.00 | نتيجة 70.6% في Terminal-Bench 4.0 |
| GPT-6.1 Sol | 29 سبتمبر | $2.00 | $10.00 | سياق بحجم 1.05 مليون token وإدخال مخزّن مؤقتاً بسعر $0.10 |
| Claude Haiku 5.5 | 7 أكتوبر | $0.10 | $0.50 | ينطبق السعر القياسي على الطلبات حتى 100 ألف token |
| Mistral Large 4 | 6 أكتوبر | $1.36 | $4.18 | نسخة تجريبية عبر API، مع خطة لإصدار الأوزان لاحقاً |
تفيد Anthropic بأن نتيجة Sonnet في Terminal-Bench 4.0 ارتفعت من 10.3% إلى 70.6%. ويقيس هذا الاختبار أداء الوكلاء الذين يعملون عبر بيئات الطرفية. أما الفرق التي عطّلت ميزة التفكير، فعليها الانتقال إلى الإعداد الجديد between_tools، لأن الإعدادات الحالية لن تعمل بالطريقة نفسها.
يأتي GPT-6.1 Sol بقيود مختلفة:
272,000 token للإدخال تُحاسب بضعف سعر الإدخال المعتاد.reasoning.effort من low إلى max.تقول OpenAI إن أداء Sol يقترب من GPT-6 Astra، لكن بسعر يعادل خمس تكلفة token القياسية في Astra، وفقاً لتغطية إطلاق DevDay. وينبغي لمعظم فرق الهندسة مقارنة معدل إكمال المهام، وتكرار المحاولات، وموثوقية استدعاء الأدوات، إلى جانب السعر الأساسي المعلن للـ token.
تحذير
لا تتعامل مع سياق GPT-6.1 Sol البالغ 1.05 مليون token باعتباره ميزة بسعر ثابت. فتجاوز حد 272,000 token يغير تكلفة الطلب كاملاً، وليس تكلفة الرموز الزائدة فقط.

أطلقت Anthropic نموذج Claude Haiku 5.5 في 7 أكتوبر، ووضعته دون Sonnet وOpus في مهام البرمجة المعقدة المعتمدة على الوكلاء. وتشمل الاستخدامات المستهدفة ضغط السياق والتلخيص والمهام المحددة للوكلاء الفرعيين، وفقاً لإعلان Haiku 5.5.
فارق السعر أكبر من أن يُتجاهل:
$0.10 لكل مليون token$0.50 لكل مليون token100,000 tokenاستخدم Haiku للمهام المحددة وعالية الحجم، مع التحقق من النتائج. وإذا فشلت المخرجات أو كانت غير مؤكدة، فحوّل المهمة إلى Sonnet أو Opus للتخطيط الغامض وتعديلات الكود الصعبة. إن إرسال كل خطوة وسيطة إلى Sonnet 5.5 يرفع تكلفة الإدخال والإخراج 20 مرة، من دون تحسن كافٍ في الإجابة النهائية يبرر ذلك.
أتاحت Mistral نموذج Large 4 كنسخة تجريبية عامة في 6 أكتوبر عبر Mistral Studio API. وتصفه الشركة بأنه نموذج من نوع مزيج الخبراء (Mixture of Experts)، يضم نحو تريليون معامل إجمالاً، مع 52 مليار معامل نشط لكل token، وفقاً للإصدار الرسمي.
تعتمد تكلفة الاستدلال على المعاملات النشطة، لا على العدد الإجمالي للمعاملات. وتشغيل جزء فقط من النموذج لكل token يمكن أن يوفر قدرات نموذج كبير من دون تنشيط الشبكة كاملة في كل طلب.
تسعير API تنافسي، لكن على الفرق التي تخطط للنشر الخاص انتظار صدور الترخيص الفعلي ومعرفة متطلبات التشغيل واستهلاك الذاكرة قبل الالتزام ببنية تقنية أو ميزانية:
$1.36 لكل مليون token$4.18 لكل مليون token
أعلنت Reflection عن Beam في 5 أكتوبر، بينما أصدرت Aleph Alpha نموذج Kolibri في 3 أكتوبر. يستخدم النموذجان بنية مزيج الخبراء المتفرقة. يتوفر Kolibri للتنزيل الآن، بينما لا يزال Beam متاحاً عبر قائمة انتظار.
| النموذج | إجمالي المعاملات | المعاملات النشطة | حالة الترخيص | الإتاحة الحالية |
|---|---|---|---|---|
| Reflection Beam | 501 مليار | 23 مليار | ترخيص Apache 2.0 مُعلن عنه | قائمة انتظار |
| Aleph Alpha Kolibri | 78 مليار | نحو 3 مليارات | Apache 2.0 متاح | أوزان قابلة للتنزيل |
| Mistral Large 4 | نحو تريليون | 52 مليار | لم يُعلن | نسخة تجريبية مستضافة عبر API |
تفيد Reflection بأن Beam حقق نتيجة 80.9 في SWE-Bench Verified. ولا يزال النموذج نصياً فقط ومتاحاً عبر قائمة انتظار، إلى حين إصدار أوزانه بترخيص Apache 2.0 كما هو مخطط لاحقاً في أكتوبر.
قد يكون Kolibri أقل إثارة، لكنه أكثر جاهزية للاستخدام. يدعم الإنجليزية والألمانية، ويوفر سياقاً يصل إلى مليون token، كما أنه منشور بالفعل بترخيص Apache 2.0. لكن تشغيله يتطلب إضافة الاستدلال الخاصة بـ Aleph Alpha لمنصة vLLM.
تحتاج عمليات نشر Kolibri التي تتجاوز 262,144 token إلى خيارات تشغيل إضافية. لذلك ينبغي للفرق اختبار استهلاك الذاكرة وزمن الاستجابة باستخدام أحجام السياق الفعلية لديها، بدلاً من التعامل مع الحد الأقصى للمواصفات باعتباره نقطة التشغيل المعتادة.
ملاحظة
الأوزان المفتوحة لا تلغي تكلفة النشر. بل تنقل مسؤولية سعة الاستدلال، والمراقبة، والتحديثات، وضوابط الأمان، ومراجعة الترخيص إلى فريقك.
أطلقت Cloudflare نموذجي Clef وClef-flash في 1 أكتوبر كنموذجي قرارات بترخيص Apache 2.0. ويعيدان مخرجات محددة النطاق والأنواع مع احتمالات، كما يوضح إعلان Clef.
تناسب هذه الواجهة عمليات التوجيه، والتحقق من السياسات، والتصنيف، وبوابات سير العمل:
@cf/cloudflare/clef.هذا هو أهم إصدار معماري في المجموعة. غالباً ما تكون نماذج القرارات الصغيرة مكوناً أفضل لبيئات الإنتاج عندما تتحكم المخرجات مباشرة في الكود. على سبيل المثال، يمكن لسير عمل الدعم توجيه طلبات الفوترة عالية الثقة تلقائياً، وإرسال الحالات منخفضة الثقة إلى موظف. ولا حاجة إلى مطالبة نموذج محادثة عام بإنتاج JSON، ثم انتظار أن يلتزم بالمخطط المطلوب.

272,000 token للإدخال قبل اعتماد Sol في مسارات العمل ذات السياق الطويل.يكشف تساوي الأسعار المعلنة عن الفروق المعمارية الكامنة وراءها، بداية من API الأدوات ورسوم السياق الإضافية، وصولاً إلى تراخيص النشر والمخرجات محددة الأنواع.
لن تعتمد المنظومة الفائزة على إرسال كل شيء إلى نموذج رائد واحد. بل ستوجّه المهام المحددة إلى وكلاء فرعيين منخفضي التكلفة، وتحتفظ بالاستدلال المكلف للقرارات الصعبة، وتستخدم نماذج قرارات حتمية عندما تحتاج البرمجيات إلى إجابة محددة النطاق. وهذه هي مشكلة التحكم نفسها التي تقف وراء الصراع الأخير حول التحكم في الوكلاء، لكن هذه الإصدارات تجعلها الآن أولوية هندسية عاجلة.