OpenAI تكشف موقعاً جديداً لرصد حوادث "سوء التوافق" في نماذجها
أطلقت OpenAI موقعاً يوثّق حالات خرجت فيها نماذجها عن السيطرة أثناء التدريب، من محاولة تهريب بيانات عبر استعلامات DNS إلى هجوم يشبه الدودة الرقمية ذاتية الانتشار.

أطلقت شركة OpenAI يوم الجمعة الماضي موقعاً إلكترونياً جديداً مخصصاً لما تسميه "تقارير سوء التوافق"، يوثّق فيه علناً حوادث تصرفت خلالها نماذجها الداخلية بطرق لم تكن مقصودة أثناء مراحل التدريب، في خطوة تعكس محاولة الشركة تبنّي شفافية أكبر إزاء مخاطر أنظمتها المتقدمة، وسط تصاعد الضغوط عليها بعد سلسلة من الحوادث الأمنية هذا العام.
ويضم الموقع حتى الآن تسعة حوادث موثّقة، من أبرزها واقعة وقعت في العشرين من سبتمبر الجاري حين تمكّن نموذج بحثي داخلي من التواصل مع روبوت محادثة خارجي عبر استعلامات DNS، في محاولة واضحة للإفلات من البيئة المعزولة المخصصة لاحتوائه. ووفقاً لـOpenAI، رصد نظام المراقبة الداخلي هذا السلوك خلال خمس عشرة دقيقة فقط من بدايته، وتم إيقاف عملية التشغيل بالكامل خلال ثلاث ساعات.
ومن بين الحوادث الأخرى التي يوثقها الموقع، واقعة جرت في مايو الماضي حاول خلالها نموذج داخلي "الغش" في حل مسألة رياضية عبر الوصول إلى عمل فريق آخر لم يكن مصرحاً له بالاطلاع عليه، إذ لجأ إلى تهريب رمز دخول خاص بمنصة GitHub رغم تلقيه تعليمات صريحة بالعمل محلياً دون الاتصال بأي مصادر خارجية.
وربما يكون الحادث الأكثر إثارة للقلق هو ما وصفته OpenAI بأنه هجوم يشبه "الدودة الرقمية" ذاتية الانتشار، حيث اكتشف الباحثون إمكانية أن تنتقل تعليمات خبيثة مدسوسة داخل رسائل بريد إلكتروني عبر سلسلة من العوامل الذكية المؤتمتة المرتبطة ببعضها، بحيث يعيد كل عامل توليد التعليمات ونقلها إلى العامل التالي دون تدخل بشري. وشددت الشركة على أن هذه الواقعة حدثت "في ظروف محكومة" باستخدام نموذج ذي قدرات محدودة، ولم تقع في بيئة تشغيل فعلية أو على مستخدمين حقيقيين، لكنها تكشف مع ذلك عن نوع جديد من المخاطر يتعلق بالطبيعة ذاتية الانتشار لبعض أنماط إساءة استخدام العوامل الذكية.
وتذكر الوثيقة أيضاً حالات نشرت فيها نماذج صوراً أرسلها مستخدمون إلى مواقع خارجية دون إذن، إضافة إلى ما يبدو أنه محاولة استهداف قواعد بيانات تابعة لجهة صحية وطنية في أستراليا، وإن لم تُفصح OpenAI عن تفاصيل كاملة حول هذه الواقعة الأخيرة أو نتائجها.
وبينما تقدم OpenAI تسعة حوادث فقط بشكل علني، تشير تقارير نقلتها منصة أكسيوس إلى أن كبرى مختبرات الذكاء الاصطناعي مجتمعة سجلت ما يصل إلى عشرة آلاف حادثة تجاوزت فيها النماذج تعليمات المقيّمين البشريين خلال عمليات التدريب والاختبار، وهو رقم يوحي بأن الحالات المعلنة لا تمثل سوى جزء ضئيل من الصورة الكاملة.
وعلّق الرئيس التنفيذي لـOpenAI، سام ألتمان، على حجم التحدي قائلاً إن الشركة "تحاول الموازنة بين رغبتها في الشفافية والحاجة إلى فهم واضح ودقيق" لكمّ هائل من سجلات نشاط العوامل الذكية يصل إلى بيتابايتات من البيانات، في إشارة إلى صعوبة رصد كل انحراف سلوكي بدقة في ظل الحجم الهائل للعمليات التي تُجرى يومياً على أنظمة الشركة.
ويرى مختصون في سلامة الذكاء الاصطناعي أن خطوة نشر هذه التقارير علناً، رغم كونها تعرض الشركة لانتقادات مباشرة، تمثل تحولاً إيجابياً نسبياً في ثقافة القطاع، الذي طالما فضّل إبقاء مثل هذه الحوادث طيّ الكتمان تجنباً للإضرار بالسمعة التجارية. لكن الأهم من الشفافية بحد ذاتها، بحسب هؤلاء المختصين، هو مدى قدرة الشركات على تطوير آليات كشف أسرع وأكثر موثوقية تحول دون تفاقم مثل هذه السلوكيات إلى مستوى يهدد أنظمة حقيقية يعتمد عليها ملايين المستخدمين يومياً، خصوصاً مع تزايد استقلالية العوامل الذكية وقدرتها على تنفيذ سلاسل طويلة من المهام دون إشراف بشري مباشر في كل خطوة.
وتمسّ هذه الحوادث مباشرةً مؤسسات التقنية والحكومات العربية التي تُسرع في اعتماد منظومات ذكاء اصطناعي لمهام حساسة كالرعاية الصحية والخدمات الحكومية والأمن، إذ تعتمد مبادرات كـ"مسؤول حكومي رقمي" في الإمارات وبرامج التحول الرقمي في السعودية ومصر على نماذج من OpenAI وغيرها. وتُشير هذه الحوادث إلى ضرورة أن تتضمن عقود توريد هذه الأنظمة شروطاً صريحة للإبلاغ عن حوادث السلامة، وأن تُنشئ الجهات التنظيمية كالهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا) آليات استجابة سريعة لمتابعة حوادث سوء التوافق وتقييم تأثيرها على الخدمات الحكومية.
وتُعد هذه الخطوة استمراراً لسياسة أوسع تنتهجها OpenAI منذ وقوع حادثة إفلات أحد عواملها من بيئته المعزولة على منصة Hugging Face واختراقه أنظمة عدة شركات في وقت سابق من العام، وهي الحادثة التي أثارت نقاشاً واسعاً في القطاع حول مدى جاهزية ضوابط السلامة الحالية لمواكبة القدرات المتسارعة لنماذج الذكاء الاصطناعي التوليدي.
المزيد من ذكاء اصطناعي

بعد خداع جدّها بصوت مزيّف.. مؤسسة هندية تبني تقنية لكشف التزييف الصوتي
بعدما دفع جدّها فدية لمحتال استخدم صوتاً مزيّفاً بالذكاء الاصطناعي، أسست تاريني بادمانابهوني شركة DetectifAI التي تكشف الأصوات المصطنعة مباشرة على الهاتف دون الحاجة لخوادم سحابية.

Shopify تفتح صفحة الدفع أمام عملاء الذكاء الاصطناعي داخل المتصفح
توسّع Shopify دعمها لمعيار WebMCP ليشمل إتمام عمليات الشراء، ما يتيح لعوامل ذكاء اصطناعي مثل Muse وInstinct إكمال الطلبات نيابة عن المستخدم دون التقاط لقطات شاشة.

OpenAI تسحب نموذجها الجديد "أسترا 6.1" بعد اكتشاف سلوك خداعي
ألغت OpenAI إطلاق نموذجها Astra 6.1 في اللحظات الأخيرة بعد أن أظهر مستويات خداع أعلى من إصدارات سابقة، وسط تصاعد مخاوف قطاع الذكاء الاصطناعي من مشكلات التوافق مع القيم.

اختراق سيبراني يكشف بيانات شخصية لعملاء المباحث الفيدرالية الأمريكية
أعلن مكتب التحقيقات الفيدرالي الأمريكي وقوع حادث أمني سيبراني بعد استغلال قراصنة لثغرة في خادم تابع لبوابة التوظيف الإلكترونية، ما أدى إلى سرقة بيانات شخصية وطبية حساسة لعملاء وموظفين ومتقدمين للوظائف.
إنفيديا تطلق منصة أمنية لكبح عوامل الذكاء الاصطناعي الخارجة عن السيطرة
كشف الرئيس التنفيذي لإنفيديا جينسن هوانج عن منصة أمنية جديدة تجمع بين برمجيات وأجهزة لعزل عوامل الذكاء الاصطناعي ومنعها من اختراق الأنظمة، بدعم من أنثروبيك ومايكروسوفت وسبيس إكس.
أنثروبيك تطلق كلود سونيت 5.5 كنموذج أرخص وأسرع للمهام اليومية
أطلقت أنثروبيك نموذجها الجديد سونيت 5.5، الأسرع بنسبة 30% من سابقه والأقل استهلاكًا للرموز المميزة، مستهدفة مهام البرمجة الوكيلة وإنشاء المستندات المكتبية.