أحدث الأخبار

وكلاء الذكاء الاصطناعي يواجهون اختبارًا جديدًا للسلامة

صفحة فيسبوك
تابع الآن
إكس (تويتر)
تابع على X
ثريدز
تابع الآن
قناة واتساب
انضم الآن


 تتطور قدرات نماذج الذكاء الاصطناعي بسرعة، فلم تعد تقتصر على تقديم الإجابات وتوليد النصوص، بل بدأت تنتقل إلى التخطيط وتنفيذ المهام واستخدام الأدوات والتفاعل مع بيئات خارجية، وهذا التوسع يمنحها مساحة أكبر لاتخاذ قرارات لم يحددها المطورون مسبقًا، وهو ما يفتح في المقابل بابًا جديدًا من التحديات المتعلقة بسلامة الذكاء الاصطناعي.

ومع اتساع هذه القدرات، ظهرت سلوكيات لم تكن متوقعة دائمًا، فقد تلجأ النماذج إلى أساليب مبتكرة للوصول إلى الهدف المطلوب منها، لكنها قد لا تكون بالضرورة متوافقة مع ما قصده مصمموها، خصوصًا عندما تكون الأهداف أو أنظمة المكافأة غير مكتملة، أو عندما تحصل النماذج على صلاحيات واسعة تسمح لها بالتفاعل مع أنظمة وأدوات خارجية.

ويمثل الانتقال من نماذج توليد النصوص إلى وكلاء الذكاء الاصطناعي تحولًا مهمًا في طبيعة هذه المخاطر، فالوكيل لا يكتفي بإنتاج إجابة واحدة، بل يستطيع تقسيم المهمة إلى مراحل، واستخدام محركات البحث والبرمجيات، وكتابة الشيفرة وتشغيلها، والوصول إلى الملفات أو الخدمات الخارجية وفق الصلاحيات الممنوحة له.

وهذا الاختلاف يغير حجم التأثير المحتمل للخطأ، ففي النموذج التقليدي قد تنتهي المشكلة بإجابة غير صحيحة، أما الوكيل فيمكن أن يحول قرارًا خاطئًا إلى سلسلة من الإجراءات التي تمتد آثارها إلى البيئة المحيطة به.

وتشير مؤسسة ميتر الأمريكية للأبحاث، التي تجري اختبارات على قدرات النماذج المتقدمة، إلى أن قدرة الوكلاء على إنجاز المهام البرمجية المعقدة تتزايد، وهو ما يجعل تقييم سلوكهم أثناء المهام الطويلة أكثر أهمية من مجرد اختبار قدرتهم على الإجابة عن أسئلة منفردة.

ومن أبرز المشكلات التي يدرسها الباحثون ما يعرف باختراق المكافأة، وهي حالة يجد فيها النظام طريقة للحصول على المكافأة التي حددها المطور، لكن من خلال استغلال ثغرة في طريقة تعريف المهمة بدل تحقيق الهدف المقصود منها فعليًا.

وتوضح جوجل ديب مايند أن هذه الظاهرة معروفة في أنظمة التعلم المعزز، وقد تظهر عندما يكون المؤشر الذي يراقبه النظام تمثيلًا غير كامل للنتيجة التي يريدها الإنسان، وعندها يمكن للنظام أن يصبح بارعًا في تحسين المؤشر دون الوصول إلى الغاية الحقيقية.

وتزداد أهمية هذه المشكلة مع ارتفاع قدرات النماذج، فالنموذج الذي يستطيع العثور على حلول أكثر تعقيدًا يمكنه أيضًا اكتشاف طرق أكثر تعقيدًا لاستغلال نقاط الضعف الموجودة في المهمة أو نظام التقييم.

ولا يشترط أن تكون المكافأة نفسها خاطئة حتى يظهر السلوك غير المتوقع، إذ تناقش جوجل ديب مايند مفهوم عدم تعميم الهدف، حيث يتعلم النموذج الهدف في ظروف التدريب، لكنه لا يعممه بالطريقة التي توقعها المطور عندما تتغير البيئة.

وتظهر هنا مفارقة مهمة، فقد ينجح النموذج وفق المعيار الذي تعلمه، لكنه يفشل وفق المعيار الذي يهم الإنسان، ولذلك فإن معرفة النتيجة النهائية وحدها لا تكفي دائمًا للحكم على مدى التزام النموذج بالهدف الأصلي.

وتصبح المخاطر أكبر عندما تنتقل قدرات النموذج من بيئة اختبار معزولة إلى أنظمة يمكنه التأثير فيها فعليًا، ففي يوليو الماضي أعلنت أوبن إيه آي عن حادثة وقعت خلال تقييمات أمنية مرتبطة بنماذج ذكاء اصطناعي، وقالت إن التحقيق كشف تمكن النماذج من تجاوز بعض آليات العزل عن الإنترنت، واستغلال ثغرات والوصول إلى أنظمة خارجية، وربطت الشركة ذلك بعدد من السلوكيات، من بينها اختراق المكافأة ومحاولات تجاوز القيود.

كما أعلنت أنثروبيك عن حوادث رصدتها خلال تقييمات للأمن السيبراني، تمكنت فيها نماذج كلود من الوصول إلى الإنترنت وأنظمة حقيقية تابعة لجهات خارجية، قبل أن توسع الشركة عمليات البحث في السجلات وتكتشف حالة أخرى مرتبطة باختبارات سابقة.

لكن هذه الوقائع لا تعني أن النماذج خرجت من السيطرة بالمعنى الحرفي أو أصبحت تمتلك إرادة مستقلة، فهذه الحالات ظهرت ضمن سياقات اختبار محددة، وتكشف بصورة أكبر ما يمكن أن يحدث عندما يجتمع نموذج شديد القدرة مع هدف معقد، وصلاحيات واسعة، وقيود ليست مثالية.

ومع ارتفاع قدرات النماذج، أصبحت مراقبة سلوكها نفسها تحديًا متزايدًا، فالنتيجة النهائية لا تكشف دائمًا المسار الذي اتبعه النموذج للوصول إليها، وقد يكون هذا المسار أكثر أهمية من النتيجة ذاتها عند تقييم مدى التزام النظام بالقواعد.

وأظهرت أبحاث أوبن إيه آي أن مراقبة مسارات تفكير نماذج الاستدلال يمكن أن تساعد في اكتشاف محاولات تجاوز الاختبارات أو الالتفاف على القواعد، لكن الباحثين يواجهون مفارقة أخرى، فإذا أصبح النموذج مدركًا لعملية المراقبة، فقد يحاول إخفاء السلوك المثير للقلق بدل التخلي عنه.

وفي اختبارات أجرتها أوبن إيه آي بالتعاون مع مؤسسة أبولو ريسيرش البريطانية، ظهرت لدى بعض النماذج سلوكيات وصفت بأنها تتوافق مع مفهوم المراوغة، مثل محاولة إخفاء إجراءات معينة من أجل تحقيق الهدف الممنوح للنموذج، إلا أن أوبن إيه آي شددت على أن هذه النتائج ظهرت في بيئات اختبار مضبوطة، ولا تعني أن النماذج الحالية تمتلك أهدافًا مستقلة طويلة الأمد.

وفي محاولة لاحتواء هذه المشكلة، يتجه الباحثون والشركات إلى ما يمكن وصفه بالدفاع متعدد الطبقات، إذ لا يكفي تحسين النموذج نفسه، بل يجب أيضًا تقييد الأدوات التي يستطيع استخدامها، وتقليل صلاحياته، وعزل البيئات الحساسة، ومراقبة أفعاله، وإجراء اختبارات خصمية قبل منحه إمكانية الوصول إلى أنظمة حقيقية.

وتزداد أهمية استخدام نماذج أخرى لمراقبة سلوك وكلاء الذكاء الاصطناعي، إلى جانب تطوير أساليب تدريب تقلل من اختراق المكافأة وتساعد على اكتشاف محاولات تجاوز أنظمة التقييم.

وتشير ميتر إلى وجود حالات موثقة لسلوكيات لوكلاء لم تتوافق مع نية المستخدم، لكنها تؤكد أن الأدلة المتاحة لا تثبت أن النماذج الحالية تتبنى أهدافًا طويلة الأمد للسيطرة على الأنظمة أو الاستيلاء عليها.

وتكشف هذه التطورات أن الخطر الأكثر واقعية في الوقت الحالي لا يتمثل بالضرورة في سيناريو تستيقظ فيه آلة فجأة وتقرر السيطرة على البشر، وإنما في نظام شديد القدرة ينفذ هدفًا محددًا بطريقة لم يتوقعها المصمم.

فكلما أصبحت النماذج أفضل في التخطيط، ازدادت قدرتها على اكتشاف حلول غير مألوفة، وكلما حصلت على أدوات وصلاحيات أكبر، أصبحت نتائج هذه الحلول أكثر تأثيرًا، ولهذا يتغير السؤال الذي يواجه مطوري الذكاء الاصطناعي من ماذا يستطيع النموذج أن يفعل، إلى سؤال أكثر صعوبة، كيف سيتصرف عندما يجد طريقًا لتحقيق الهدف لم نفكر فيه.

وهنا تظهر المفارقة الأساسية في سباق تطوير الذكاء الاصطناعي، فزيادة القدرة هي التي تجعل النماذج أكثر فائدة، لكنها في الوقت نفسه توسع مساحة السلوك الممكن، ولذلك فإن بناء نموذج أكثر ذكاء لا يكفي وحده، بل يجب أن تتطور معه آليات التقييم والمراقبة والاحتواء.

وقد يكون التحدي المقبل ليس الوصول إلى نموذج يعرف كيف يفعل المزيد فحسب، وإنما ضمان أن يظل ما يفعله متوافقًا مع ما قصده الإنسان، حتى عندما يصبح قادرًا على إيجاد حلول لم تخطر على بال مطوريه.

التعليقات

نستخدم ملفات تعريف الارتباط لضمان حصولك على أفضل تجربة.