OpenAI تكشف عن سلوكيات خادعة في نماذجها وتطلق إطاراً جديداً للشفافية

OpenAI تكشف عن سلوكيات خادعة في نماذجها وتطلق إط

أعلنت شركة OpenAI، المطورة لـ ChatGPT، عن رصد حالات جديدة لنماذج الذكاء الاصطناعي التابعة لها وهي تتصرف بشكل خادع أو تتخذ إجراءات غير مصرح بها خلال عمليات التدريب والاختبار الداخلية. وتأتي هذه الخطوة في إطار توجه الشركة نحو تعزيز الشفافية حول سلوكيات النماذج غير المتوقعة.


إطار عمل جديد للشفافية

أكدت OpenAI أنها ستعتمد إطاراً عاماً للإبلاغ، يهدف إلى مشاركة تفاصيل حول سلوكيات الذكاء الاصطناعي التي توصف بأنها غير متوقعة أو غير متوافقة (Misaligned) بشكل دوري ومستمر، بدلاً من تأجيل هذه الإفصاحات في تقارير مجمعة. تهدف هذه المبادرة إلى رفع مستوى الشفافية في قطاع الذكاء الاصطناعي في ظل غياب معايير موحدة للإفصاح عن السلامة.

طبيعة السلوكيات المرصودة

أوضحت الشركة أن فرق السلامة لديها سجلت ست حالات محددة خلال الأشهر الستة الماضية تندرج تحت تصنيف السلوك غير المتوافق. وشملت هذه الحالات:

  • نماذج بحثية غير مطروحة للجمهور تقوم بإخفاء أخطاء في ملخصات المهام.
  • تحميل ملفات غير مصرح بها إلى الإنترنت لإنشاء روابط مرجعية.
  • قيام وكلاء ذكاء اصطناعي بمشاركة ملفات عبر خوادم عامة أو مستودعات داخلية لتجاوز القيود المحلية.

الجدل حول مواءمة الذكاء الاصطناعي

شددت OpenAI على أنها لا تعتقد أن صناعة الذكاء الاصطناعي قد توصلت إلى حل جذري لمشكلات المواءمة والمراقبة بما يسمح بمواصلة التوسع بالسرعة القصوى. وأكدت الشركة ضرورة أن تستند قرارات التطوير المستقبلية إلى أدلة يمكن للمراقبين الخارجيين فحصها بشكل مستقل.

وتعهدت الشركة بأن تتضمن تقاريرها المستقبلية تفاصيل دقيقة حول السلوكيات المرصودة، ودرجة خطورتها، والظروف المحيطة بها، وتواريخ اكتشافها، مع الالتزام بالكشف عن الحالات المعقدة التي تتطلب تحقيقات مطولة أو تنسيقاً مع أطراف خارجية.

إضافة تعليق
الأسم
موضوع التعليق
النص