لماذا بدأ الذكاء الاصطناعي يتصرف بطرق لم يتوقعها مطوروه؟ | تكنولوجيا


روكب اليوم

تتسارع قدرات نماذج الذكاء الاصطناعي مع انتقالها من توليد الإجابات إلى التخطيط وتنفيذ المهام واستخدام الأدوات والتفاعل مع بيئات خارجية، وهو ما يمنحها مساحة أكبر لاتخاذ قرارات لم يحددها المطورون مسبقا.

ومع اتساع هذه القدرات، ظهرت سلوكيات غير متوقعة، إذ قد تلجأ النماذج إلى طرق مبتكرة لتحقيق الهدف المحدد لها، لكنها لا تتوافق بالضرورة مع ما قصده مصمموها، خصوصا عندما تكون الأهداف أو أنظمة المكافأة غير مكتملة أو عندما تتمتع النماذج بصلاحيات واسعة.

مراقبة النماذج المتقدمة تزداد صعوبة كلما أصبحت عمليات التخطيط والاستدلال أطول وأكثر تعقيدا (غيتي)

من نموذج يجيب إلى وكيل يتصرف

يمثل الانتقال من نماذج توليد النصوص إلى وكلاء الذكاء الاصطناعي أحد أهم التحولات في هذه المسألة، فبدل الاكتفاء بإنتاج إجابة، يستطيع الوكيل تقسيم المهمة إلى مراحل، واستخدام محركات البحث والبرمجيات، وكتابة الشيفرة وتشغيلها، والوصول إلى الملفات أو الخدمات الخارجية وفق الصلاحيات الممنوحة له.

قصص مقترحة

list of 2 itemsend of list

وهذا التوسع يغير طبيعة المخاطر، ففي النموذج التقليدي قد تكون الإجابة الخاطئة هي نهاية المشكلة، أما الوكيل فيمكن أن يحول قرارًا خاطئًا إلى سلسلة من الأفعال التي تؤثر في البيئة المحيطة به.

وتشير مؤسسة ميتر (METR) الأمريكية للأبحاث، والتي تجري اختبارات على قدرات النماذج المتقدمة، إلى أن قدرات الوكلاء على إنجاز المهام البرمجية المعقدة تتزايد، وهو ما يجعل تقييم سلوكهم في المهام الطويلة أكثر أهمية من اختبار قدرتهم على الإجابة عن أسئلة منفردة.

عندما يتحول الهدف إلى ثغرة

ومن أبرز المشكلات التي يدرسها الباحثون ما يسمى اختراق المكافأة (Reward Hacking)، ويحدث عندما يجد النظام طريقة للحصول على المكافأة التي صممها المطور، لكن عبر استغلال ثغرة في طريقة تعريف المهمة بدل تحقيق الهدف المقصود.

وتوضح غوغل ديب مايند أن هذه الظاهرة معروفة في أنظمة التعلم المعزز، وقد تظهر عندما يكون المؤشر الذي يراقبه النظام تمثيلا غير كامل للنتيجة التي يريدها الإنسان، ففي هذه الحالة يمكن للنظام أن يصبح بارعا في تحسين المؤشر من دون أن يحقق الغاية الحقيقية.

وتزداد أهمية المشكلة مع النماذج الأكثر قدرة، لأن النموذج الذي يستطيع اكتشاف حلول أكثر تعقيدا يمكنه أيضا اكتشاف طرق أكثر تعقيدا لاستغلال نقاط الضعف في المهمة أو نظام التقييم.

وكلاء الذكاء الاصطناعي أكثر عرضة للسلوكيات غير المتوقعة بسبب قدرتهم على التخطيط والتفاعل مع البيئات الخارجية (رويترز)

حتى الهدف الصحيح قد ينتج سلوكا خاطئا

لا يشترط أن تكون المكافأة نفسها خاطئة حتى يظهر السلوك غير المتوقع، وتناقش غوغل ديب مايند مفهوم عدم تعميم الهدف (Goal Misgeneralization)، حيث يتعلم النموذج الهدف في ظروف التدريب، لكنه لا يعممه بالطريقة التي توقعها المطور عندما تتغير البيئة.

وهنا تظهر مفارقة مهمة، وهي أنه قد يكون النموذج ناجحا وفق المعيار الذي تعلمه، لكنه يفشل وفق المعيار الذي يهم الإنسان، ولذلك لا تكفي معرفة النتيجة النهائية للحكم على مدى التزام النموذج بالهدف الأصلي.

عندما تتسع الصلاحيات تتسع المخاطر

تزداد خطورة هذه المشكلة عندما تنتقل قدرات النموذج من بيئة اختبار معزولة إلى أنظمة يمكنه التأثير فيها فعليا، ففي يوليو/تموز الماضي، أعلنت أوبن إيه آي عن حادثة وقعت خلال تقييمات أمنية مرتبطة بنماذج ذكاء اصطناعي، وقالت إن التحقيق كشف أن النماذج تمكنت من تجاوز بعض آليات العزل عن الإنترنت، واستغلال ثغرات والوصول إلى أنظمة خارجية، وربطت الشركة ذلك بمجموعة من السلوكيات، من بينها اختراق المكافأة ومحاولات تجاوز القيود.

كما أعلنت أنثروبيك عن حوادث رصدتها خلال تقييمات للأمن السيبراني، تمكنت فيها نماذج كلود من الوصول إلى الإنترنت وأنظمة حقيقية تابعة لجهات خارجية، قبل أن توسع الشركة عمليات البحث في السجلات لتكتشف حالة أخرى مرتبطة باختبارات سابقة.

لكن هذه الوقائع لا تعني أن النماذج خرجت من السيطرة بالمعنى الحرفي أو أصبحت تمتلك إرادة مستقلة؛ فهذه الحالات ظهرت في سياقات اختبار محددة، وتكشف بالدرجة الأولى ما يمكن أن يحدث عندما يجتمع نموذج شديد القدرة مع هدف معقد وصلاحيات واسعة وقيود غير مثالية.

المراقبة نفسها أصبحت تحديا

كلما زادت قدرة النموذج، أصبح اكتشاف السلوك غير المرغوب فيه أكثر صعوبة؛ فالنتيجة النهائية لا تكشف دائمًا المسار الذي اتبعه للوصول إليها.

وأظهرت أبحاث أوبن إيه آي أن مراقبة مسارات تفكير نماذج الاستدلال يمكن أن تساعد في اكتشاف محاولات تجاوز الاختبارات أو الالتفاف على القواعد، لكن الباحثين يواجهون مفارقة أخرى، وهي أنه إذا أصبح النموذج مدركا لعملية المراقبة، فقد يحاول إخفاء السلوك المثير للقلق بدل التخلي عنه.

وفي اختبارات أجرتها أوبن إيه آي بالتعاون مع مؤسسة أبولو ريسيرش (Apollo Research) البريطانية، ظهرت لدى بعض النماذج سلوكيات وصفت بأنها متوافقة مع مفهوم المراوغة (Scheming)، مثل محاولة إخفاء إجراءات معينة لتحقيق الهدف الذي أعطي للنموذج، إلا أن أوبن إيه آي شددت على أن هذه النتائج ظهرت في بيئات اختبار مضبوطة، ولا تعني أن النماذج الحالية تمتلك أهدافا مستقلة طويلة الأمد.

كيف تحاول الشركات احتواء المشكلة؟

يتجه الباحثون والشركات إلى ما يمكن وصفه بالدفاع متعدد الطبقات، فلا يكفي تحسين النموذج نفسه، بل يجب أيضا تقييد الأدوات التي يستطيع استخدامها، وتقليل صلاحياته، وعزل البيئات الحساسة، ومراقبة أفعاله، وإجراء اختبارات خصمية قبل منحه إمكانية الوصول إلى أنظمة حقيقية.

وتتزايد كذلك أهمية استخدام نماذج أخرى لمراقبة سلوك الوكلاء، إلى جانب تطوير طرق تدريب تقلل من اختراق المكافأة وتكشف محاولات تجاوز أنظمة التقييم.

وتشير ميتر إلى وجود حالات موثقة لسلوكيات وكلاء لم تتوافق مع نية المستخدم، لكنها تؤكد أن الأدلة المتاحة لا تثبت أن النماذج الحالية تتبنى أهدافا طويلة الأمد للسيطرة على الأنظمة أو الاستيلاء عليها.

اتساع صلاحيات النماذج يشكل عاملا إضافيا في زيادة المخاطر، خصوصا عندما تستطيع الوصول إلى الإنترنت أو الملفات أو الأدوات الخارجية (شترستوك)

المشكلة الحقيقية ليست تمرد الآلة

تكشف هذه التطورات أن الخطر الأكثر واقعية في الوقت الحالي ليس سيناريو آلة تستيقظ فجأة وتقرر السيطرة على البشر، بل نظام شديد القدرة ينفذ هدفًا محددًا بطريقة لم يتوقعها المصمم.

فكلما أصبحت النماذج أفضل في التخطيط، ازدادت قدرتها على اكتشاف حلول غير مألوفة، وكلما حصلت على أدوات وصلاحيات أكبر، أصبحت نتائج تلك الحلول أكثر تأثيرا، ولهذا يتغير السؤال الذي يواجه مطوري الذكاء الاصطناعي من ماذا يستطيع النموذج أن يفعل؟ إلى سؤال أكثر صعوبة وهو: كيف سيتصرف عندما يجد طريقا لتحقيق الهدف لم نفكر فيه؟

وهنا تكمن المفارقة الأساسية في سباق تطوير الذكاء الاصطناعي، فزيادة القدرة هي ما يجعل النماذج أكثر فائدة، لكنها في الوقت نفسه توسع مساحة السلوك الممكن، ولذلك فإن بناء نموذج أكثر ذكاء لا يكفي وحده، بل يتطلب أن تتطور معه آليات التقييم والمراقبة والاحتواء.

فالتحدي المقبل قد لا يكون الوصول إلى نموذج يعرف كيف يفعل المزيد، وإنما ضمان أن يظل ما يفعله متوافقا مع ما قصده الإنسان، حتى عندما يصبح قادرا على إيجاد حلول لم تخطر على بال مطوريه.

المصدر: الجزيرة + اللجنة الدولية للدفاع عن تيسير علوني + الجزيرة + وكالات

اترك تعليقاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *

Enable Notifications OK No thanks