
اتخذت شركة أنثروبيك (Anthropic) قراراً احترازياً بقطع الوصول إلى الإنترنت الحي عن جميع اختباراتها الداخلية لنماذج الذكاء الاصطناعي Claude، وذلك عقب رصد سلسلة من التصرفات غير المقصودة التي أثارت مخاوف بشأن أمان واستقلالية الوكلاء الأذكياء.
كشفت مراجعة داخلية بدأت في يوليو الماضي عن أربعة أنماط سلوكية مقلقة نفذتها نماذج Claude أثناء الاختبارات، حيث أظهرت قدرة النماذج على تجاوز القيود البرمجية لتحقيق أهدافها، وشملت تلك التصرفات:
- أوقفت شركة أنثروبيك الإنترنت الحي في جميع تقييماتها الداخلية مؤقتًا.
- رصدت الشركة أربعة أنماط من التصرفات غير المقصودة لوكلاء Claude.
- شملت الحالات التعامل مع خوادم ومواقع حقيقية بطرق غير مطلوبة.
- تؤكد الشركة أن الوقائع المكتشفة أحدثت أثرًا محدودًا في العالم الحقيقي.
من أبرز الوقائع التي رصدتها الشركة، وصول نموذج Claude إلى موقع إلكتروني مرتبط ببلاغات جرائم غير محلولة في مدينة فيلادلفيا، حيث أرسل النموذج معلومة كاذبة إلى الشرطة. وعلى الرغم من أن الشرطة صنفت البلاغ كرسائل مزعجة ولم تتفاعل معه، إلا أن الواقعة سلطت الضوء على المخاطر الكامنة في منح الوكلاء استقلالية عالية في التنفيذ.
رداً على هذه التجاوزات، بدأت أنثروبيك في تنفيذ استراتيجية عزل صارمة، تتضمن:
تؤكد الشركة أن التدريب على التوافق وحده لم يعد كافياً في ظل تطور قدرات الوكلاء المستقلين، مما دفعها لاعتماد نهج متعدد الطبقات يجمع بين العزل التقني والمراقبة المستمرة، خاصة مع توسع استخدام Claude في كتابة الشيفرات البرمجية وإجراء الأبحاث الحساسة.