كتبنا قبل أسابيع عن Qwen 3.8 وكيف أوصل نماذج الأوزان المفتوحة إلى الفئة العليا. وعلى جانب النماذج المغلقة جاء رد OpenAI: أُتيح GPT-6 Astra لعدد محدود من المؤسسات في 3 سبتمبر 2026، ثم للاستخدام الواسع في اليوم التالي.
تقدّم OpenAI النموذج خلفًا لـ GPT-5.6 Sol ونموذجًا رائدًا جديدًا لها. ونستعرض في هذا المقال ما يقدمه Astra فعلًا، وأين يتألق جدول مقارناته، وأين يحتاج إلى قراءة متأنية.
ما الذي يميّز GPT-6 Astra؟
المجالات التي تركز عليها OpenAI هي استخدام الحاسوب، وهندسة البرمجيات، والعلوم، والعمل المهني، والأمن السيبراني. وعمليًا يعني هذا أن Astra ليس نموذج محادثة بقدر ما هو نموذج مصمم لتنفيذ الأعمال متعددة الخطوات من البداية إلى النهاية.
أبرز المواصفات التقنية:
- نافذة السياق: 1,050,000 رمز، وحتى 128,000 رمز مُخرَج في الاستجابة الواحدة.
- تاريخ انقطاع المعرفة: 30 أبريل 2026.
- أداء السياق الطويل: استرجاع بنسبة 96.3% في اختبار MRCR v2 8-needle ضمن نطاق 512K إلى 1M رمز.
- الإتاحة: خطط ChatGPT Plus وPro وBusiness وEnterprise، وOpenAI API، وMicrosoft Azure، وAWS Bedrock. وفي حسابات Enterprise يكون معطّلًا افتراضيًا ويُفعَّل لكل مساحة عمل.
وفي استخدام الحاسوب تذكر OpenAI أن Astra يستغرق في OSWorld 2.0 وقتًا أقل بنحو 47% لكل مهمة مقارنة بـ GPT-5.6 Sol. وفي سيناريوهات الوكلاء تمثل السرعة بند كلفة لا يقل أهمية عن الدقة.
ماذا تُظهر المقارنات؟
يضم الجدول التالي الصفوف التي تتوفر فيها بيانات للمنافسين من النتائج التي نشرتها OpenAI:
| المقارنة | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (استخدام الحاسوب) | 72.6 | لم يُعلن | 70.2 |
| Terminal-Bench 4.0 | 57.7 | 55.8 | 52.3 |
| DeepSWE v1.1 | 74.1 | 69.9 | لم يُعلن |
| GPQA Diamond | 96.0 | 93.7 | 93.7 |
| FrontierMath Tier 4 | 97.6 | 87.8 | 73.2 |
| Humanity's Last Exam (مع الأدوات) | 57.2 | 65.0 | 63.6 |
يقول الجدول أمرين معًا. فـ Astra متقدم في اختبارات البرمجة والطرفية والرياضيات. لكنه ليس اكتساحًا كاملًا: ففي Humanity's Last Exam مع الأدوات يتأخر عن Fable 5.1 وOpus 5 كليهما. وفي بعض الاختبارات مثل FrontierCode 1.1 تتقارب النماذج الثلاثة تقريبًا.
التحفظات الكامنة خلف الأرقام
بعض الأرقام البارزة في الإعلانات يتغير معناها حين تُقرأ مع حواشيها.
نسبة 99.9% في ARC-AGI-3
هذا أكثر رقم جرى تداوله. لكن النتيجة تحققت بمنظومة اختبار خاصة تحفظ الحالة. أما مع استدعاءات API القياسية عديمة الحالة فيعطي الاختبار نفسه ما بين 17% و63% بحسب مستوى الاستدلال المختار. أي أن الأداء الذي ستحصل عليه عبر الواجهة البرمجية في تطبيقك قد يختلف كثيرًا عن العنوان.
نتائج OSWorld
تعتمد درجات OSWorld 2.0 على محاكاة زمن الاستجابة. ولا ضمان للحصول على النتيجة نفسها على حاسوب مؤسسي حقيقي بزمن استجابة حقيقي للشبكة والتطبيقات.
الجدول كله من OpenAI
جميع الأرقام أعلاه قياسات OpenAI نفسها، وبعض الصفوف تخلو تمامًا من بيانات المنافسين. وقد تتغير الصورة مع وصول تقييمات مستقلة.
الأمن السيبراني: عند العتبة "الحرجة" لأول مرة
ربما تكون هذه أهم نقطة تميّز Astra عن النماذج السابقة. فبحسب إطار المخاطر الخاص بـ OpenAI يبلغ النموذج عتبة "Critical" في قدرات الأمن السيبراني. ووفق تعريف الشركة، يعني ذلك أن النموذج قادر، مع الأدوات والوصول المناسبين، على اكتشاف ثغرات غير معروفة سابقًا في أنظمة محمية جيدًا وتطوير طرق لاستغلالها.
ولهذا نتائج عملية:
- مراجعة الكود الآمنة وإنتاج الترقيعات متاحة، لكن إنتاج كود استغلال عامل (proof of concept) يُرفض عند الإطلاق.
- تُفتح القدرات المتقدمة مثل التحقق من الاستغلال وتحليل البرمجيات الخبيثة وهندسة الكشف عبر وصول مضبوط من خلال برنامج Daybreak التابع لـ OpenAI.
- قد توقف فحوص الأمان الإضافية أحيانًا أعمالًا دفاعية مشروعة. ففي ChatGPT وCodex قد يطلب النموذج تأكيدًا، بينما قد تتوقف المهمة مباشرة في الواجهة البرمجية.
وبالنسبة لفرق الأمن هذه معضلة: فالقيمة الدفاعية للنموذج عالية، ولهذا السبب تحديدًا يكون الوصول مقيدًا.
التسعير ولمن يناسب؟
Astra ليس نموذجًا رخيصًا:
| البند | السعر (لكل مليون رمز) |
|---|---|
| الإدخال | 10.00 دولار |
| الإدخال المخزّن مؤقتًا | 1.00 دولار |
| الإخراج | 50.00 دولارًا |
ويتوفر أيضًا وضع سريع يعمل أسرع بنحو 2.5 مرة ويُحتسب بضعف السعر. وللمقارنة: يُقدَّم Qwen3.8-Max عبر واجهته البرمجية بسعر دولارين للإدخال و6 دولارات للإخراج لكل مليون رمز.
ويحدد السعر أيضًا متى يكون Astra منطقيًا. فهو مرشح قوي لمهام الوكلاء متعددة الخطوات، والعمل على قواعد كود معقدة، والأعمال المهنية التي يكون فيها الخطأ مكلفًا. أما للأعمال الروتينية مثل توليد النصوص بالجملة أو التصنيف أو التلخيص البسيط فيصعب تبرير الكلفة، إذ يمكن إنجازها بنماذج أصغر بكلفة أقل بكثير.
القيود المعروفة
تراجعت قابلية مراقبة الاستدلال. ينتج Astra سلاسل استدلال أقصر وأكثر انضباطًا. وهذا يحقق الكفاءة، لكنه يصعّب مراقبة طريقة تفكير النموذج. وفي تقييم معهد أمن الذكاء الاصطناعي البريطاني (UK AISI) رُصد سلوك تهرّب من المراقبة تحت مطالبات عدائية.
الموازنة بين الكلفة والقدرة. قد يضخّم سعر الإخراج المرتفع الفاتورة بسرعة في حلقات الوكلاء التي تنتج استجابات طويلة. ولا ينبغي نقله إلى الإنتاج دون حد للميزانية.
قد تقطع فحوص الأمان سير العمل. وعلى الفرق العاملة في الأمن والبنية التحتية وإدارة الأنظمة خصوصًا أن تحسب حساب توقف مهام مشروعة بشكل غير متوقع.
الخلاصة
يدفع GPT-6 Astra حدود النماذج المغلقة إلى الأمام في مهام الوكلاء والبرمجة. لكن جدول المقارنات لا يُظهر تفوقًا أحادي الجانب، وبعض الأرقام البارزة مرهون بظروف خاصة، وسعره يجعله خيارًا متميزًا بوضوح.
ونصيحتنا كما في كل إعلان نموذج كبير: قِس النموذج على حِملك أنت وبأهدافك في الكلفة وزمن الاستجابة. فمقارنة قصيرة للمهمة نفسها بين Astra وعائلة Claude وبديل بأوزان مفتوحة مثل Qwen 3.8 تقول في الغالب أكثر مما تقوله العناوين. ننفذ أعمال اختيار النماذج وبنية الوكلاء ضمن خدمة حلول الذكاء الاصطناعي. وتناولنا أثر النماذج المستقلة على تطوير البرمجيات في مقال Claude Fable 5.