Loading blog posts...
Loading blog posts...
جاري التحميل...

يُعد GPT-6 Astra ذكاءً اصطناعياً عاماً (AGI) وفق تعريف عملي قابل للتطبيق. يمكنه فهم نتيجة عامة مطلوبة، واستخدام البرامج المعتادة، وفحص النتائج، والتعافي من الأخطاء، وإنجاز أعمال مفيدة في مجالات غير مترابطة. وأقوى دليل على ذلك ليس نتيجة اختبار معياري، بل حلقة العمل المغلقة.
بدلاً من الجدل حول الوعي، استخدم هذا الاختبار المكوّن من 5 أجزاء:
| القدرة | الاختبار العملي | الدليل المطلوب فحصه |
|---|---|---|
| تفسير الهدف | قبول نتيجة مطلوبة بدلاً من تعليمات تفصيلية | هل يخطط للخطوات الوسيطة؟ |
| استخدام الأدوات | تشغيل المتصفحات والطرفيات والملفات والبرامج الاحترافية | هل يستطيع التنقل بين التطبيقات؟ |
| فحص النتائج | التحقق من المخرجات بصرياً ووظيفياً | هل يلاحظ التخطيطات المعطلة أو الإجراءات الفاشلة؟ |
| التعافي من الأخطاء | تغيير النهج بعد الفشل | هل يستطيع المتابعة من دون تصحيح بشري؟ |
| الإكمال | تسليم مخرج قابل للاستخدام | هل النتيجة جاهزة للمراجعة أو النشر؟ |
روبوت محادثة يشرح كيفية تحديث سجل في CRM لا يجتاز الاختبار. أما النظام الذي يسجل الدخول، ويعثر على الحساب، ويحدّث السجل، ويتحقق من القيمة المحفوظة، ثم يؤكد اكتمال المهمة، فهو يجتازه.
تشير تقارير إلى أن رئيس OpenAI، غريغ بروكمان، وصف هذه الفترة بأنها بداية عصر AGI. لكن هذا التصريح أقل أهمية من السلوك الذي يمكن ملاحظته. فمصطلحات الشركات لا تستطيع حسم فئة تقنية وفلسفية ما زالت محل خلاف.
وفق الاختبار العملي، يمكن الدفاع عن وصف GPT-6 Astra بأنه AGI. وتشمل قدراته الموثقة إدخال الصور، واستخدام الأدوات، والتفاعل مع الكمبيوتر، وإعدادات استدلال تبدأ من low وتصل إلى max، وفق الوثائق الرسمية لنموذج GPT-6 Astra. يمتلك النموذج نافذة سياق تبلغ 1,050,000 رمز، وحداً أقصى للمخرجات يبلغ 128,000 رمز، مع حد معرفي حتى 30 أبريل 2026. وتدعم هذه الحدود العمل على مستودعات الكود، والمواد البحثية، ولقطات الشاشة، وملفات الأعمال، وسجلات التنفيذ الطويلة.
Note
لا يعني AGI العملي امتلاك الوعي، أو الحكم المثالي، أو الاستقلالية غير المحدودة، أو الأداء المتساوي في كل مهمة. بل يصف عتبة القدرة على تنفيذ أعمال عامة وموجّهة نحو هدف.
لماذا يهم ذلك: يصبح AGI قابلاً للاختبار عندما يعني النجاح إنجاز العمل، لا مجرد إجراء محادثة مقنعة.
تشير التقارير إلى أن GPT-6 Astra حقق نتيجة 62.7% في ARC-AGI-3 باستخدام منظومة الاختبار القياسية وبأقصى جهد. ثم ارتفعت النتيجة إلى 98.6% مع منظومة Provider Adapter، وفق تقييم ARC Prize لنموذج Astra.
يختبر ARC-AGI-3 قدرة النموذج على الاستكشاف والتكيف داخل بيئات تفاعلية غير مألوفة. ويتعين على النموذج استنتاج القواعد الخفية من الملاحظات، بدلاً من استرجاع أنماط إجابات مألوفة.
الفارق البالغ 35.9 نقطة مئوية ليس تفصيلاً هامشياً. تستطيع منظومة Provider Adapter الاحتفاظ بالاستدلال وضغط سجل التفاعلات السابقة بطريقة مختلفة. وهذا يغيّر المعلومات التي تظل متاحة للنموذج أثناء تنفيذ مهمة طويلة.
في تقييمات الوكلاء، يتكون النظام الخاضع للاختبار من النموذج، وسياسة السياق، والذاكرة، والأدوات، ومنطق إعادة المحاولة، وطريقة عرض الملاحظات. اعتبار التشغيلين اختباراً واحداً يخفي حقيقة هندسية مهمة: قد تحدد عملية التنسيق ما إذا كان النموذج سيبدو مرتبكاً أم كفؤاً.
تظهر HardBench وTerminal-Bench 4 أيضاً ضمن المقارنات المنشورة. لكن نتائجهما لا تكون ذات قيمة إلا عند توضيح إصدار الاختبار بدقة، والبيئة، وصلاحيات الأدوات، ومستوى جهد الاستدلال، والمهلة الزمنية، وسياسة إعادة المحاولة.
Warning
لا تقارن النسب المئوية لاختبارات الوكلاء قبل التحقق من منظومة الاختبار. فقد تنتج الحالة الدائمة، وإعادات المحاولة الخفية، وضغط السياق، والوكلاء الفرعيون نظاماً مختلفاً، حتى لو ظل اسم النموذج كما هو.
لماذا يهم ذلك: نتائج Astra مثيرة للإعجاب، لكن الفارق بين منظومات الاختبار يثبت أن تقييم AGI يجب أن يشمل نظام التشغيل الكامل المحيط بالنموذج.

تخيّل مهمة تمتد عبر عدة تطبيقات: البحث عن شركة، والتحقق من بيانات الاتصال بها، وتحديث سجلها في CRM، وصياغة رسالة بريد إلكتروني مناسبة، ثم تسجيل النتيجة. وفق التقارير، يستطيع Astra تصفح المواقع، وملء النماذج، وفحص الشاشات، وتحديث السجلات، ومتابعة العمل بين التطبيقات، كما توضّح إرشادات نموذج GPT-6 Astra.
يظهر السلوك الحاسم بعد تنفيذ الإجراء. يستطيع Astra التحقق من نجاح إرسال نموذج، وملاحظة فشل تثبيت برنامج، وتعديل خطته، ثم تجربة مسار آخر. دورة التصحيح هذه هي ما يفصل توليد النصوص عن القدرة على التصرف.
إنشاء قائمة تعليمات تبدو معقولة أمر سهل. لكن الحفاظ على حالة المهمة في أثناء ظهور شاشات غير متوقعة، وأخطاء تحقق، واعتماديات مفقودة، ونتائج جزئية، أصعب بكثير.
تنطبق الحلقة نفسها على العمل المكتبي. يستطيع النموذج تثبيت البرامج، وتشغيل المتصفح، وفحص الملفات، ومعالجة الأعطال، ثم العودة إلى الهدف الأصلي. وهنا ينتقل الإشراف البشري من توجيه كل نقرة إلى تحديد الحدود ومراجعة المخرج النهائي.
لذلك، لا يكون أهم مقياس للتقييم هو عدد الرموز في الثانية. بل معدل الإكمال المتحقق منه: أي نسبة المهام التي تنتهي بعد تأكيد الوصول إلى الحالة المطلوبة من خلال فحص مستقل.
لماذا يهم ذلك: النظام القادر على ملاحظة فشله ومواصلة العمل حتى الإكمال يتجاوز عتبة أهم بكثير من نظام لا يفعل سوى توليد إجابات أفضل.
تكشف لعبة سباق عربات مولّدة قدرات النموذج أكثر من لقطة شاشة مصقولة. فعلى النموذج ربط الإدخال، والحركة، والاصطدام، والكاميرات، وهندسة المسار، والإضاءة، واحتساب النقاط، والملاحظات ضمن نظام تفاعلي واحد.
تشمل عروض Astra المنشورة نسخة شبيهة بلعبة Minecraft، تحتوي على shaders، وأيقونات للعناصر، ومزارع، وإضاءة، وحركة لتكسير الكتل، وسلوك للمياه. كما يعرض مثال آخر إنشاء مدينة داخل Unity بدلاً من إنتاج نموذج بصري ثابت، وفق إرشادات النموذج الرسمية.
تجعل تكاملات Playbot مع Unity وGodot هذه الحلقة أكثر وضوحاً. يمكن للنموذج تعديل مشهد، وتشغيل الإصدار، وفحص ما حدث، وتحديد الأعطال، ثم تعديل الأصول أو المنطق داخل المحرك.
تشير التقارير إلى إنتاج 3 نماذج أولية بطابع القراصنة والحلوى والسايبربانك، انطلاقاً من لعبة أولية واحدة بتصميم grey-box. عملت معظمها من المحاولة الأولى، مع انخفاض الإصلاحات اليدوية بنحو 50% مقارنة بالنموذج السابق. هذه نتائج منشورة من المورّد، لذلك تظل ملفات المشروع، ومعايير القبول، وإعدادات المقارنة مهمة.
تذهب حالة Unreal Engine إلى أبعد من ذلك. فقد أنشأ Astra، وفق التقارير، عالماً كبيراً تسكنه شخصيات يتحكم فيها النموذج، وتتعاون وتبقى على قيد الحياة وتتحدث مع بعضها. أما قصة الصوت داخل الشقة المرتبطة بهذا العمل، فتبقى رواية غير رسمية وليست دليلاً مقاساً.
للتعمق في هذا النمط الإنتاجي، راجع OpenAI Astra يحوّل طلباً واحداً إلى عمل ثلاثي الأبعاد مكتمل.
لماذا يهم ذلك: يختبر العمل التفاعلي ثلاثي الأبعاد الاستدلال السببي والمكاني والبصري والإجرائي ضمن مهمة واحدة، ما يجعله دليلاً أقوى من جودة الصور وحدها.

أعطِ Astra مجلداً يحتوي على جداول بيانات، ومستندات مرجعية، وملفات هوية بصرية، ومتطلبات عرض تقديمي. لا تقتصر القدرة المعلنة على التلخيص. بل تشمل تحليل جداول البيانات، والتصنيف، والصيغ، وتنسيق المستندات، وإنشاء العروض التقديمية، وتطوير الواجهات الأمامية، وتعديل SVG، والمراجعة النهائية.
تستخدم هذه المخرجات تمثيلات مختلفة. يجب أن تنفذ صيغ جداول البيانات العمليات الحسابية بشكل صحيح. ويجب أن تحافظ عناصر SVG على هندستها. كما يجب أن تلتزم العروض التقديمية بالمراجع. أما الواجهات الأمامية، فيجب أن تعمل داخل المتصفح، لا أن تبدو مقنعة في الكود المولّد فحسب.
تشير إرشادات GPT-6 Astra أيضاً إلى قدرته على الكتابة باستخدام عبارات نمطية أقل شيوعاً في محتوى الذكاء الاصطناعي. هذا تحسن مهم، لكنه دليل أضعف من النجاح في التنقل بين البحث، والكود، والفحص البصري، وبرامج الأعمال.
تختبر معايير البرمجة مهارة تقنية مركزة. لكن فكرة الذكاء العام تصبح أكثر إقناعاً عندما يستطيع النموذج نفسه الانتقال من تحليل البيانات إلى بناء واجهة، ثم فحص النتيجة وإصلاحها.
وهنا أيضاً يجب رفع معايير المراجعة. قد يحتوي جدول بيانات مصقول على صيغة خاطئة. وقد يعرض تقديم احترافي معلومات غير دقيقة عن أحد المصادر. يجب ألا تحل الجودة البصرية محل التحقق المستقل.
لماذا يهم ذلك: يدعم التنوع في إنجاز مخرجات غير مترابطة وصف AGI أكثر من التفوق في اختبار واحد للبرمجة أو الاستدلال.
يمكن للمنتجات التي تحتاج إلى التحكم في الكمبيوتر واستدعاء الأدوات الوصول إلى Astra عبر Responses API من OpenAI، باستخدام معرّف النموذج gpt-6-astra. ويجب اختيار مستوى جهد الاستدلال بما يناسب المهمة. فالإعدادات المنخفضة تلائم التحويلات المحدودة، بينما قد تتطلب الأعمال الصعبة الممتدة عبر عدة تطبيقات جهداً high أو max.
يبلغ السعر الأساسي الموثق $10 لكل مليون رمز إدخال، و$1 لكل مليون رمز إدخال مخزّن مؤقتاً، و$50 لكل مليون رمز إخراج. وتخضع الطلبات التي تتجاوز 272,000 رمز لأسعار أعلى. في المقابل، يمكن لخيارَي Batch وFlex خفض التكلفة لأعباء العمل التي تتحمل المعالجة المتأخرة أو المتغيرة، وفق صفحة نموذج GPT-6 Astra.
يوفر تطبيق ChatGPT لسطح المكتب وCodex مساراً آخر عندما يحتاج Astra إلى وصول مضبوط للملفات المحلية، أو الطرفيات، أو المتصفحات، أو تطبيقات سطح المكتب. ويجري توفير الوصول على مراحل، بدءاً من عدد محدود من المؤسسات، ثم التوسع ليشمل مستخدمي Plus وPro وBusiness وEnterprise وAPI. كما تُذكر AWS باعتبارها مسار وصول مخططاً له. ويجب التحقق من الإتاحة حسب الحساب والمنطقة في يوم النشر، بدلاً من افتراضها بناءً على إعلان.
تحل بيئات التشغيل الدائمة مشكلة مختلفة:
| خيار التنفيذ | الدور | الأنسب له |
|---|---|---|
| Responses API | استدعاء الأدوات وتنسيق عمل النموذج | تكاملات المنتجات |
| ChatGPT لسطح المكتب وCodex | وصول مضبوط إلى التطبيقات المحلية | أعمال المطورين والمعرفة |
| OpenClaw أو Hermes | بيئة تشغيل دائمة للوكلاء | المهام الذاتية طويلة التشغيل |
| Docker | تجميع التطبيقات والاعتماديات | التنفيذ القابل للتكرار |
| AWS | حوسبة وتخزين وشبكات مُدارة | البنية التحتية للإنتاج |
| Abacus AI Supercomputer | كمبيوتر دائم التشغيل يمكن التحكم فيه باللغة الطبيعية | التطبيقات المستضافة والعمل من دون إشراف |
يستطيع Abacus AI Supercomputer إبقاء الوكيل متصلاً، واستضافة تطبيق عام، وربط التخزين أو قاعدة بيانات، ومواصلة العمل بعد إغلاق الكمبيوتر المحمول للمستخدم. ويوفر OpenClaw وHermes بيئات تشغيل دائمة للوكلاء، بينما يجمع Docker البرامج التي يحتاج Astra إلى تشغيلها.
لا تثبت هذه الطبقات وجود الذكاء. لكنها تضيف استمرارية التشغيل، والعزل، والشبكات، والتخزين، والحالة القابلة للاستعادة. والخلط بين بنية النشر التحتية وقدرات النموذج يؤدي إلى ادعاءات مبالغ فيها.
تناسب World of AI وVibe Coding Benchmark ومكتبات الطلبات سير عمل الاختبار أكثر. ويمكنها توفير مهام قابلة للتكرار، لكنها ليست دليلاً أساسياً على AGI العملي.
لماذا يهم ذلك: لا يصبح الذكاء العام مفيداً اقتصادياً إلا عندما يمتلك بيئة آمنة ودائمة وقابلة للمراقبة حتى يعمل داخلها.
تشير التقارير إلى أن تكلفة GPT-6 Astra لكل رمز تبلغ نحو 2.5 ضعف تكلفة GPT-5.6 Sol. لكن هذه المقارنة غير مكتملة، لأن الرموز الأرخص قد تؤدي إلى نتيجة أعلى تكلفة إذا احتاج النموذج إلى مزيد من المحاولات، أو التدخل البشري، أو مسار تنفيذ أطول.
استغرقت تجربة منشورة لمحاكي طيران نحو 20.5 دقيقة، واستهلكت قرابة 1.63 مليون رمز، وبلغت تكلفتها نحو $28. أما تجربة Sol المنشورة فبلغت تكلفتها $661، لكن ذلك لا يمثل ترتيباً منصفاً بين النموذجين. فقد عمل Astra بإعداد Ultra ومع 6 وكلاء فرعيين، بينما عمل Sol منفرداً بإعداد High. ويظهر Claude Fable 5.1 كنموذج آخر للمقارنة، لكن اختلاف جهد الاستدلال، وعدد الوكلاء، وطريقة إدارة السياق، وسياسات الأدوات يمنع الوصول إلى نتيجة مضبوطة.
| بُعد التكلفة | ما يجب قياسه |
|---|---|
| استخدام النموذج | تكلفة رموز الإدخال، والإدخال المخزّن مؤقتاً، والإخراج |
| وقت التشغيل | وقت الحوسبة والأدوات |
| المراجعة البشرية | الدقائق المستغرقة في فحص المخرجات وتصحيحها |
| التعافي | إعادة المحاولات، وإعادة التشغيل، وتكرار استدعاءات الأدوات |
| الإكمال | نسبة المهام المقبولة من دون إعادة عمل |
| المخاطر | التكلفة المتوقعة للإجراءات الخاطئة أو غير الآمنة |
الوحدة الأفضل هي تكلفة كل مهمة مقبولة. فقد يكون النموذج الأعلى سعراً أقل تكلفة إذا أنجز المهمة من أول مرة. لكنه قد يصبح أغلى بكثير عندما يُستخدم سياق طويل، واستدلال max، ووكلاء فرعيون من دون ضوابط للميزانية.
يمكن للفرق التي تقيّم حزم الوكلاء مقارنة هذا النمط بسير العمل المذكور في الاتجاهات الأسبوعية لمطوري الذكاء الاصطناعي: حزم الوكلاء تتصدر المشهد.
لماذا يهم ذلك: يقيس سعر الرموز حجم الاستهلاك، بينما تقيس تكلفة المهمة المكتملة قيمة العمل.
تعامل مع Astra كمشغّل يمتلك صلاحيات، لا كمساعد للكتابة. تمنحه بطاقة نظام GPT-6 Astra تصنيفاً حرجاً في الأمن السيبراني، وتصف إجراءات حماية أقوى.
ينبع هذا التصنيف مباشرة من حلقة العمل. فالنموذج القادر على تثبيت البرامج، وتشغيل الطرفيات، وفحص الأعطال، وتعديل نهجه يستطيع تنفيذ مهام إدارية مفيدة. لكن القدرات نفسها قد تدعم الاختراق، أو الحفاظ على الوصول، أو الاستغلال الآلي.
يثير انخفاض قابلية المراقبة مشكلة أخرى. إذا جرى ضغط الاستدلال الحاسم أو إخفاؤه أو توزيعه بين وكلاء فرعيين، فقد يرى المراجعون الإجراءات من دون الحصول على تفسير موثوق لكيفية تطور الخطة.
لا تزال الأعمال المولّدة تحتاج إلى مراجعة. وقد تبقى مهام الكمبيوتر بطيئة. كما يمكن أن تتغير حالة المتصفح، أو تُفهم الصلاحيات بشكل خاطئ. وقد تخفي النتيجة الصحيحة بصرياً أخطاء واقعية أو مالية أو أمنية.
تشمل الضوابط المناسبة بيانات اعتماد بأقل قدر من الصلاحيات، وبيئات معزولة، وقوائم نطاقات مسموح بها، وحدوداً للإنفاق، وسجلات تدقيق غير قابلة للتعديل، وبوابات موافقة قبل تنفيذ إجراءات مدمرة أو خارجية. كما تحتاج مهام العمل عالية التأثير إلى فحوص مستقلة لا تعتمد على مراجعة Astra لعمله بنفسه.
Important
لا تمنح وكيلاً مستقلاً صلاحية وصول لمجرد أن المستخدم البشري يمتلكها بالفعل. أنشئ بيانات اعتماد خاصة بالمهمة، بصلاحيات أضيق وفترات انتهاء قصيرة.
أقوى حجة لوصف Astra بأنه AGI هي أيضاً سبب وجيه لنشره بحذر. فالنظام القادر على إنجاز الأعمال العامة يستطيع أيضاً إنجاز أعمال ضارة.
لماذا يهم ذلك: الأمان ليس شرطاً نضيفه بعد وصف النظام بأنه AGI. بل هو دليل على أن الاستقلالية العملية أصبحت ذات عواقب حقيقية.

اختر 5 مهام من مجالات غير مترابطة، وحدد اختبارات القبول قبل تشغيلها. وقد تشمل مجموعة مناسبة إصلاح جدول بيانات، والبحث عبر المتصفح، وتحديث CRM، وتعديل واجهة أمامية، وتصحيح تطبيق غير مألوف.
تتبّع معدل الإكمال، والوقت المستغرق، وتكلفة الرموز، والتدخلات البشرية، والإجراءات غير الآمنة، والعيوب النهائية. وشغّل كل مهمة باستخدام الصلاحيات نفسها، ومستوى جهد الاستدلال نفسه، والمهلة الزمنية نفسها، وسياسة إعادة المحاولة نفسها.
بعد ذلك، غيّر عاملاً واحداً في كل مرة. قارن بين إدارة السياق القياسية والاستدلال المحتفظ به، وبين وكيل واحد ووكلاء فرعيين، وبين جهد high وmax. سيكشف النمط ما إذا كان التحسن ناتجاً عن النموذج، أو منظومة الاختبار، أو زيادة القدرة الحاسوبية.
يجتاز Astra العتبة العملية لـ AGI عندما ينجز مراراً أعمالاً غير مألوفة ومتعددة المجالات، من دون توجيه بشري خطوة بخطوة. عرض واحد مثير للإعجاب لا يكفي.
لماذا يهم ذلك: تحوّل اختبارات حلقة العمل المضبوطة نقاش AGI إلى سؤال هندسي له نتائج قابلة للملاحظة.
ابدأ من هنا
اختر مهمة واحدة تُنفذ عبر المتصفح ولها حالة نهائية واضحة، ثم سجّل ما إذا كان Astra يستطيع إكمالها من دون تنقل بشري.
نتائج سريعة
تعمّق أكثر
يستحق GPT-6 Astra وصف AGI وفق تعريف عملي، لأنه يستطيع السعي نحو النتائج من خلال التخطيط، واستخدام الأدوات، والفحص، والتصحيح، والإكمال. ويأتي أقوى دليل على ذلك من حلقات العمل الكاملة عبر المتصفحات، والملفات، والبرامج الاحترافية، والكود، والبيئات التفاعلية ثلاثية الأبعاد.
لكن الادعاء ما زال يواجه حدوداً واضحة. فقد يؤدي تصميم منظومة الاختبار إلى تضخيم المقارنات. كما تظل مهام الكمبيوتر طويلة التشغيل مكلفة وبطيئة. وتحتاج الأعمال المولّدة إلى مراجعة، بينما لا تسمح إعدادات الاختبارات غير المتطابقة بترتيب النماذج بدقة.
لم يعد السؤال المفيد هو ما إذا كان Astra يبدو ذكياً. بل ما إذا كان يستطيع إكمال مهمة محددة بأمان، وبشكل متكرر، وبتكلفة إجمالية مقبولة. ويمكن للمطورين الإجابة عن ذلك باستخدام تقييمات مضبوطة لحلقة العمل، بدلاً من انتظار اتفاق عالمي على معنى كلمة AGI.