Loading blog posts...
Loading blog posts...
جاري التحميل...

ألغت OpenAI نموذج GPT-6.1 Astra بعد فشله في اختبارات المواءمة الداخلية، وذلك في اليوم نفسه الذي أطلقت فيه Nvidia بيئة تشغيل مصممة لاحتواء الوكلاء المستقلين. يبدو أن افتراض منح أحدث نموذج صلاحية العمل في بيئة الإنتاج تلقائياً لم يعد صالحاً. تشير أحدث أخبار AI هذا الأسبوع إلى محور جديد للمنافسة: تنفيذ منخفض التكلفة ضمن حدود قابلة للفرض.
أطلقت Anthropic نموذج Claude Opus 5.5 في 22 سبتمبر، ثم Claude Sonnet 5.5 في 28 سبتمبر. وتقول الشركة إن سرعة إخراج النموذجين زادت بأكثر من 30% مقارنة بالإصدارات السابقة. في الوقت نفسه، حافظ Sonnet على سعر API للجيل السابق، وهو $2 لكل مليون token إدخال و$10 لكل مليون token إخراج.
حقق Sonnet 5.5 نتيجة 70.6% في اختبار Terminal-Bench 4.0، الذي يغطي المهام المنفذة عبر الطرفية. وهذا يجعله خياراً واضحاً لوكلاء البرمجة، وأتمتة البنية التحتية، وصيانة مستودعات البرمجيات.
لكن آلية توجيه السلامة السيبرانية فيه تترك أثراً تشغيلياً أكبر: فقد تعود الطلبات الأعلى خطورة بشكل واضح إلى Sonnet 5. لذلك قد يمر طلبان أُرسلا إلى Sonnet 5.5 عبر نموذجين مختلفين، ما يغيّر زمن الاستجابة وسلوك الأدوات وجودة المخرجات. يجب أن تسجل حزم التقييم أحداث التوجيه إلى جانب الأوامر والاستجابات وأعداد الـ tokens. فأي اختبار معياري يتجاهل النموذج الفعلي يظل ناقصاً.
يأتي Opus 5.5 بقيد مختلف. لم يعد من الممكن تعطيل وضع التفكير فيه، كما تبلغ تكلفته $4 لكل مليون token إدخال و$20 لكل مليون token إخراج. تقول Anthropic إن أداءه يقترب من Claude Fable 5.1 في معظم المهام. لكن فرض الاستدلال يجعله خياراً افتراضياً غير مناسب لمهام التصنيف أو الاستخراج البسيطة، حيث تكون السرعة والتكلفة المتوقعة أهم من التحليل العميق.
للاطلاع على مقارنة أوسع مع دورة الإصدارات السابقة، راجع أبرز توجهات تطوير AI أسبوعياً: GPT-6 وClaude 5.5 والوكلاء.
بدأ مزودو النماذج يدمجون قرارات السياسات داخل عملية الاستدلال نفسها. لذلك يجب أن يتجاوز الرصد التشغيلي للتطبيقات مجرد تسجيل الطلب والاستجابة.

وصل GPT-6 Sol وGPT-6 Luna إلى API وCodex وChatGPT Work في 22 سبتمبر. وتقول OpenAI إن أسعار API أقل بنسبة 50% من الأسعار الترويجية لـ GPT-5.6، مع تقديم Luna باعتباره مناسباً للاستخراج واسع النطاق، والملخصات الأولية، والمهام الروتينية المشابهة.
يمكن لـ Sol التعامل مع المهام التي تبرر فيها قوة الاستدلال الإضافية تكلفته. أما Luna، فيستوعب قوائم طويلة من المهام منخفضة التعقيد. إرسال كل مهمة إلى نموذج رائد واحد لمجرد أن إضافة طبقة توجيه تبدو مزعجة هو خيار مكلف. ومع سرعة الإصدارات الحالية، أصبح التوجيه الصريح جزءاً من بنية التطبيق، لا مجرد وسيلة اختيارية لتقليل التكلفة.
بعد ذلك، ألغت OpenAI نموذج GPT-6.1 Astra. وقالت رئيسة أنظمة السلامة Saachi Jain إن النموذج لم يستوفِ المعايير الداخلية المتعلقة بنطاق العمل، والتفويض، وطريقة إبلاغ المستخدمين بالمهام التي أنجزها. وهذه كلها إخفاقات في حوكمة الوكلاء: الالتزام بالمهمة المحددة، والحصول على إذن قبل توسيع نطاقها، ووصف الإجراءات المنفذة بدقة.
إلغاء النموذج أهم من تحقيق فوز جديد في اختبار معياري. فقد أصبحت القدرات نفسها سبباً محتملاً لتأجيل الإصدار عندما تتجاوز استقلالية النموذج ثقة المزود في قدرته على التحكم فيه. تستحق OpenAI الإشادة على إيقاف الإطلاق. لكن العملاء ما زالوا بحاجة إلى ضوابطهم الخاصة، لأن التقييمات الداخلية لا يمكنها تمثيل كل أداة إنتاج أو هيكل صلاحيات أو حدود بيانات.
يوفر Grok 4.7 نافذة سياق بحجم 500k token، بالأسعار المنشورة نفسها لـ Grok 4.6. تكلف الأوامر التي يقل حجمها عن 200k token مبلغ $2 لكل مليون token إدخال و$6 لكل مليون token إخراج. وعند تجاوز هذا الحد، ترتفع الأسعار إلى $4 و$12.
قد تبدو نافذة السياق هي الخبر الأبرز، لكن حد التسعير أكثر فائدة عملياً. فالوكيل الذي يضيف باستمرار مخرجات المتصفح والسجلات واستجابات الأدوات قد يتجاوز 200k دون تحسن مماثل في جودة الاستدلال. عندها تؤدي الإدارة الضعيفة للسياق إلى مضاعفة سعر الـ tokens.
يغري السياق الطويل الفرق أيضاً بوضع كل المستندات في أمر واحد وترك النموذج يتولى فرزها. قد ينجح ذلك في التحقيقات العرضية، لكنه يجعل فحص مدى صلة المعلومات أصعب، كما يزيد تكلفة إبطال السياق أو تحديثه. لذلك تظل تقنيات الاسترجاع، ونقاط التحقق من التلخيص، وذاكرة الوكيل المنظمة مفيدة، حتى عندما يستطيع النموذج استقبال مجموعة العمل كاملة.
يُعد Grok 4.7 خياراً جذاباً لتحليل قواعد الشفرة، والمواد القانونية الطويلة، والتحقيقات التي تشمل مستندات متعددة وتحتاج إلى ربط تفاصيل متباعدة. أما الوكلاء الذين ينفذون مهام متكررة، فسيستفيدون غالباً من ضغط الذاكرة بشكل مدروس لإبقاء الأوامر دون حد التسعير.
حللت Transluce عدداً قدره 37,649 تقريراً عن أنشطة شبيهة بالوكلاء، جُمعت عبر urlquery.net. وشملت الأنشطة محاولات SQL injection وpath traversal ضد مكتبة رقمية جامعية، مع استمرار حركة البيانات حتى 16 سبتمبر على الأقل.
لا يشترط وجود نية خبيثة حتى تظهر المشكلة. فقد ينشئ وكيل يستكشف موقعاً عناوين URL غير صحيحة، أو يتبع أنماطاً شبيهة بالهجمات تعلمها من بيانات التدريب، أو يختبر مدخلات لم يصرح بها المشغّل البشري. وبالنسبة إلى مالك الموقع، قد تبدو المحاولات العرضية والمتعمدة متطابقة في سجلات الوصول.
يكشف قرار Amazon حظر وكيل التسوق Muse التابع لـ Meta الجانب التجاري من هذه الحدود. يتلقى مستخدمو Muse الذين يحاولون إتمام الشراء الآن إشعاراً يفيد بأن استمرار وصول وكيل AI غير مصرح له يخالف شروط استخدام Amazon. قد يكون الوكيل قادراً تقنياً على إكمال العملية، لكنه لا يملك إذناً من الخدمة التي يعتمد عليها.
ليست كل عملية متاحة عبر المتصفح متاحة تلقائياً لوكيل AI. تحتاج أتمتة المتصفح إلى قوائم نطاقات مسموح بها، وموافقة مخصصة لكل إجراء، وحدود لمعدل الطلبات، وهوية واضحة تُعرض للخدمة المستهدفة.
للفرق التي تتعامل مع قضايا الخصوصية والتحقق الأوسع، يستعرض أبرز توجهات تطوير AI أسبوعياً: الوكلاء والخصوصية والتحقق الإشارات المبكرة التي قادت إلى هذا التحول.
توفر منصة Open Agent Safety Platform من Nvidia طبقتين لاحتواء الوكلاء. OpenShell هو برنامج مفتوح المصدر يتتبع الإجراءات ويفرض حدود السياسات، بينما يعمل تصميم المراقبة Sentry على وحدات معالجة البيانات BlueField-4.
غالباً ما تطبق أطر عمل الوكلاء السياسات داخل العملية نفسها التي تقرر الإجراء المطلوب. وإذا استطاع النموذج أو كود التنسيق تجاوز تلك السياسة، تصبح الحدود أقرب إلى إرشادات غير ملزمة. أما بيئة التشغيل الخارجية، فيمكنها فحص استدعاءات الأدوات والوصول إلى الشبكة ومحاولات التنفيذ قبل وصولها إلى النظام الأساسي.
ينقل Sentry العزل إلى أجهزة مخصصة، وقد صُمم لوضع الوكيل في الحجر خلال أجزاء من الثانية. لن يناسب هذا الأسلوب كل بيئة تشغيل، خصوصاً التطبيقات الصغيرة التي لا تستخدم بنية Nvidia التحتية، لكن مبدأ التصميم سليم. تحتاج الوكلاء ذات التأثير الكبير إلى طبقة تحكم لا تستطيع إعادة كتابتها عبر كود مولّد أو التلاعب بالأوامر.
قد تقلل الأوامر الأفضل السلوك غير الآمن، لكن فرض السياسات يجب أن يحدث عند حدود الشبكة والعمليات وبيانات الاعتماد والأدوات. وينبغي تقييم OpenShell بناءً على دقة السياسات، والتكلفة الإضافية للتتبع، ومدى تكامله مع أنظمة الهوية الحالية.

أطلقت Google نموذجي Gemini 3.8 Flash TTS وFlash-Lite TTS عبر Gemini API وAI Studio. يدعم النموذجان أكثر من 100 لغة، ويتضمنان أكثر من 2,000 صوت جاهز، مع تطبيق العلامة المائية SynthID على كل مقطع يُنشأ.
الميزة الأكثر فائدة هي التحكم في الإلقاء على مستوى كل سطر. يمكن للمطورين تحديد سرعة الكلام، والتوجيه العاطفي، والأحداث الصوتية مثل الضحك ضمن تعليمات مكتوبة. ويقلل ذلك الحاجة إلى إنشاء عدة تسجيلات كاملة أو دمج مقاطع منفصلة عندما تتغير نبرة الحوار.
من المرجح أن يصبح Flash-Lite الخيار الافتراضي للسرد واسع النطاق، والتوطين، والواجهات الحوارية. أما نموذج Flash الكامل، فيكون أنسب عندما تؤثر جودة الإلقاء مباشرة في المنتج، كما في حوارات الشخصيات أو التدريب الموجّه. وتكتسب SynthID أهميتها لأن التحكم البرمجي في التعبير يجعل اكتشاف الصوت الاصطناعي بالاستماع وحده أكثر صعوبة.
بدأ توليد الصوت يتبنى أسلوب عمل توليد النصوص: توجيهات منظمة، وتكرار سريع، وإنتاج يعتمد على النماذج. لذلك يجب أن ترافق بيانات المصدر والموثوقية الوسائط منذ إنشائها، مروراً بالتخزين، وحتى التوزيع.
أطلقت Black Forest Labs نموذج FLUX 3 Action، وهو نموذج مفتوح الأوزان بحجم 7B يستقبل إطاراً من الكاميرا مع تعليمات نصية، ثم يعيد إجراءات الروبوت للثانيتين التاليتين. وقد دُمجت نقاط التحقق الخاصة به في LeRobot، ويُوزع بموجب FLUX Kommunity License v1.0.
توفر الفترات القصيرة للإجراءات حداً عملياً للسلامة، لأن النظام يضطر إلى مراقبة البيئة مرة أخرى قبل التخطيط لحركته التالية. لكنها تزيد أيضاً متطلبات التنسيق. تحتاج منظومة الروبوت الفعالة إلى إدراك سريع، واستدلال متكرر، ومشرف قادر على إيقاف الإجراءات عندما تنحرف البيئة عن افتراضات النموذج.
يواجه تطوير البرمجيات الضغط التشغيلي نفسه. أعادت Linear بناء أجزاء من مسار التكامل المستمر لديها بعد أن رفعت البرمجة باستخدام AI معدل إنتاج الكود، ما جعل CI عنق الزجاجة الجديد. ساعد الانتقال إلى tsgo وOxlint، بينما حقق وضع الاختبار الاختياري isolate: false أكبر تحسن منفرد، إذ خفّض التكاليف الشهرية بنحو 17%.
عندما تنتج النماذج الإجراءات أو الكود بوتيرة أسرع، تصبح بنية التحقق التحتية هي المورد المحدود. فالتوليد الأسرع من دون تحقق أسرع يؤدي إلى قوائم انتظار أطول، وتكاليف أعلى، وفترة أوسع لانتشار المخرجات السيئة.

ستُقاس المرحلة المقبلة من المنافسة في AI بمدى أمان النماذج وانخفاض تكلفة إنجازها لمهام محددة الحدود. لا تزال القدرات الخام مهمة، لكن إلغاء Astra، والتحويل الواضح في Claude، وفرض السياسات عبر OpenShell، وحظر Amazon للوكلاء، كلها تشير إلى الاتجاه نفسه: التفويض يتحول إلى ميزة أساسية في المنتج.