أطلقت شركة جوجل نموذج جيميناي 4 أرغون، Gemini 4 Argon، وتقدمه باعتباره أحدث نماذجها الرائدة وأكثرها قدرة حتى الآن، مع تركيز واضح على تنفيذ المهام المعقدة التي تمتد عبر مراحل متعددة، بدلًا من الاكتفاء بإنتاج إجابات قصيرة أو تنفيذ أوامر منفردة.
ويستهدف جيميناي 4 أرغون بشكل خاص هندسة البرمجيات والعمل المعرفي المتخصص والأمن السيبراني، في توجه يعكس محاولة جوجل دفع نماذج الذكاء الاصطناعي نحو تنفيذ المهام الطويلة والمعقدة بدرجة أكبر من الاستقلالية.
ومن أبرز التحسينات التقنية التي يحملها النموذج رفع حد الإخراج إلى مليون رمز، Token، مقارنة بـ64 ألف رمز في النموذج السابق، بحسب جوجل. وتقول الشركة إن هذه المساحة الأكبر تتيح للنموذج الاستمرار في عمليات استدلال طويلة وتنفيذ مئات الآلاف من الرموز ضمن مسار واحد، ما يجعله أكثر ملاءمة للمشكلات التي تحتاج إلى تحليل متتابع بدلًا من سلسلة قصيرة من التعليمات.
وتعني هذه القدرة عمليًا أن النموذج يستطيع التعامل مع مشاريع برمجية ضخمة أو مهام بحثية متعددة المراحل ضمن سياق واحد، مع الاحتفاظ بكمية أكبر من المعلومات الضرورية لمواصلة المهمة دون الحاجة إلى تقسيمها إلى أجزاء صغيرة، وتؤكد جوجل أن هذا النهج يمثل جزءًا أساسيًا من تصميم أرغون وليس مجرد زيادة في حجم نافذة السياق.
وتضع جوجل البرمجة في مقدمة الاستخدامات المستهدفة للنموذج، مشيرة إلى أن مهندسيها يستخدمونه في تصحيح الأخطاء وتصميم الخوارزميات وترحيل قواعد شيفرة ضخمة بين لغات البرمجة.
وتقول الشركة إن وكلاء أرغون يعملون على ترحيل قواعد شيفرة مكتوبة بلغتي سي C وسي++ C++ إلى رَست Rust، ووصل حجم إحدى عمليات الترحيل إلى أكثر من 800 ألف سطر في نواة نظام فوشيا زيركون، Fuchsia Zircon.
كما تشير جوجل إلى أن النموذج حقق نتيجة بلغت 77.9% في اختبار ديب إس دبليو إي 1.1، DeepSWE v1.1، الذي يهدف إلى قياس أداء نماذج الذكاء الاصطناعي في مهام هندسة البرمجيات الواقعية طويلة المدى.
وفي تجربة أخرى، تقول جوجل إن وكلاء أرغون أعادوا كتابة 32 ألف سطر من شيفرة إس آي إم دي، SIMD، في مشروع ليب غاف 1، libgav1، ما نتج عنه إصدار رَست أسرع بنحو 2.7 مرة من نسخة رَست السابقة، مع الحفاظ على المخرجات نفسها.
وتؤكد الشركة أن عمليات إعادة الكتابة البرمجية واسعة النطاق لا تعتمد على النموذج وحده، إذ تخضع لمراجعة واختبارات آلية ويدوية قبل اعتمادها في بيئات الإنتاج.
ولا يتوقف جيميناي 4 أرغون عند البرمجة، فقد صممته جوجل أيضًا لتنفيذ مهام معرفية متخصصة في مجالات مثل التمويل والقانون والضرائب، وتقول الشركة إن النموذج حقق أداء متقدمًا في اختبارات تتضمن البحث المالي متعدد الخطوات، والبحث والصياغة القانونية، ومهام الأعمال التي تتطلب تنفيذ سلسلة كاملة من الإجراءات.
كما تشير جوجل إلى امتلاك النموذج قدرات متعددة الوسائط، من بينها تحليل الرسوم البيانية وفهم مقاطع الفيديو الطويلة، حيث سجل 91.7% في اختبار إل في بنش، LVBench، المخصص لقياس قدرات فهم مقاطع الفيديو الطويلة.
ويحتل الأمن السيبراني مكانة محورية في إطلاق جيميناي 4 أرغون، إذ تقول جوجل إن النموذج قادر على اكتشاف الثغرات البرمجية والتحقق منها وإعداد إصلاحات لها بصورة ذاتية.
وحقق النموذج 68% في اختبار سي دبليو إي بنش 1، CWE-bench v1، الخاص بمعالجة الثغرات البرمجية، وهي نتيجة تقول جوجل إنها تعادل أفضل نتيجة مسجلة في هذا الاختبار.
وتستخدم جوجل هذه القدرات ضمن برنامج فيرويند، Fairwind، الذي يتيح النموذج لمجموعة مختارة من المدافعين في مجال الأمن السيبراني، مع فرض ضوابط وصول صارمة تقصر الاستخدام على فرق الأمن السيبراني والاستجابة للحوادث واختبارات الاختراق، إلى جانب مهام دفاعية وبحثية محددة.
وعلى خلاف إطلاق نموذج جديد أمام المستخدمين مباشرة، اختارت جوجل طرح أرغون بصورة تدريجية، إذ بدأت بإتاحته لمختبرين موثوقين ومدافعين سيبرانيين ضمن برنامج فيرويند، بينما تعمل على اختبار إجراءات الحماية قبل توسيع نطاق الوصول إلى المطورين والشركات والمستخدمين.
وتشمل إجراءات الحماية، بحسب جوجل، مقاومة إساءة الاستخدام والهجمات المعروفة باسم حقن التعليمات غير المباشر، Indirect Prompt Injection، إلى جانب أنظمة لمراقبة سلوك النموذج وإيقاف التنفيذ عند رصد أي انحراف عن حدود المهمة، فضلًا عن استخدام بيئات اختبار معزولة للعمليات عالية الخطورة.
وأشارت وكالة رويترز إلى أن جوجل لم تحدد موعدًا لإطلاق عام كامل للنموذج، بينما قالت الشركة إن إتاحته ستتوسع تدريجيًا، بدءًا من عملاء واجهة برمجة التطبيقات، API، المدفوعة ومشتركي جوجل إيه آي ألترا، Google AI Ultra.
ويعكس إطلاق جيميناي 4 أرغون توجهًا متزايدًا لدى جوجل نحو نماذج لا تركز فقط على جودة الإجابة، وإنما على الاستمرار في تنفيذ العمل عبر مراحل متعددة حتى الوصول إلى النتيجة النهائية، وتبرز تطبيقات البرمجة والبحث المالي والقانوني والأمن السيبراني هذا التوجه بشكل واضح.
لكن أداء أرغون لا يتفوق في جميع الاختبارات، إذ نقلت رويترز عن الشركة أن النموذج يتفوق على نماذج منافسة في بعض المؤشرات، بينما يتأخر عنها في مؤشرات أخرى، من بينها اختباران من أصل 4 اختبارات مرتبطة بالبرمجة أوردتها جوجل.
ولهذا، فإن أهمية جيميناي 4 أرغون لا ترتبط فقط بنتيجة معيارية واحدة أو مقارنة مباشرة مع النماذج المنافسة، بل بمحاولة جوجل تطوير نموذج قادر على التعامل مع أعمال طويلة ومعقدة، ومواصلة تنفيذها عبر مراحل متعددة، وصولًا إلى نتيجة نهائية بدرجة أكبر من الاستقلالية.

إرسال تعليق