تخيل أداة لا تحاول اختراق خادم أو سرقة بيانات، بل تحاول إقناع نموذج ذكاء اصطناعي متقدم بأن يتجاهل قواعد الأمان التي بُني عليها.
هذا بالضبط ما شاهدته أداة جديدة وهي تختبر نماذج تابعة لأربع من أكبر شركات الذكاء الاصطناعي في العالم. والنتائج كانت مقلقة أكثر مما قد تتوقع.
الأداة لم تُستخدم لاختراق أحد، ولم تُستخدم لبناء سلاح أو تنفيذ هجوم حقيقي. الهدف كان أبسط من ذلك، قياس مدى قدرة النماذج المتقدمة على مقاومة محاولات الـ Jailbreak وتجاوز القيود الأمنية الموضوعة حولها.
#أكثر من ألف محاولة لكسر نموذج واحد
منظمة FAR.AI غير الربحية والمتخصصة في أبحاث سلامة الذكاء الاصطناعي، طورت أداة تأخذ مجموعة من الطلبات الخطرة أو الحساسة، ثم تولد منها أكثر من ألف نسخة مختلفة.
الفكرة بسيطة.
إذا رفض النموذج الطلب الأول، يتم تغيير الصياغة والسياق وطريقة الطلب، ثم إعادة المحاولة مرة أخرى.
وفي بعض الحالات استمر النظام في تجربة عشرات الصيغ المختلفة حتى وجد الطريقة التي تجعل النموذج يتجاوز قيوده.
خلال الاختبارات ظهرت نماذج قادرة على إنتاج خطة تفصيلية لهجوم سيبراني يستهدف سدا كهرومائيا افتراضيا، رغم أن كثيرا من المحاولات السابقة كانت تُرفض مباشرة.
وهنا تظهر المشكلة الحقيقية.
نظام الحماية قد ينجح في رفض الطلب مرة، لكنه قد يفشل عندما يتم تغيير الطريقة التي يُقدم بها نفس الطلب.
#من تم اختباره
اختبرت FAR.AI نماذج متقدمة من أربع شركات أمريكية بارزة في مجال الذكاء الاصطناعي.
شملت الاختبارات نماذج Claude Opus 4.8 وFable 5 من Anthropic، ونماذج GPT 5.5 وGPT 5.6 من OpenAI، وGemini 3.1 Pro من Google، إضافة إلى Grok 4.3 وGrok 4.5.
الأداة أنشأت تلقائيا مطالبات مصممة لدفع النماذج نحو محتوى يفترض أن تمنعه أنظمة الأمان.
من بين السيناريوهات التي تم اختبارها، توليد برمجيات استغلال، وإنتاج تفاصيل تتعلق بأسلحة كيميائية أو بيولوجية، بالإضافة إلى سيناريوهات أخرى عالية الخطورة.
#Grok كان الأكثر قابلية للكسر
بحسب التقرير، كان Grok النموذج الأكثر عرضة لمحاولات الـ Jailbreak.
تم العثور على 448 حالة Jailbreak ناجحة ضده.
جاء Gemini بعده مع 249 حالة.
في المقابل، لم تنجح الهجمات المستخدمة في هذا الاختبار في تجاوز الحماية لدى Claude وFable وGPT.
لكن هذه النتيجة لا تعني أن تلك النماذج غير قابلة للكسر.
الاختبار يقيس مجموعة محددة من أساليب الهجوم، بينما توجد تقنيات أكثر تعقيدا تعتمد على محادثات طويلة، أو تدرج في الطلبات، أو تلاعب بالسياق، أو استخدام أكثر من نموذج في نفس سلسلة الهجوم.
بمعنى آخر، عدم نجاح هذه المجموعة من الاختبارات لا يعني أن النموذج محصن بالكامل.
#تكلفة كسر النموذج قد تكون أقل من المتوقع
التقرير لم يكتف بقياس عدد حالات الـ Jailbreak.
الباحثون حاولوا أيضا حساب تكلفة استخدام نموذج ذكاء اصطناعي لتوليد محاولات Jailbreak آليا ضد نموذج آخر.
النتيجة كانت لافتة.
بحسب FAR.AI، بلغت تكلفة الوصول إلى Jailbreak ناجح ضد Grok نحو 58 دولارا فقط.
أما Gemini فبلغت التكلفة المقدرة لكسره نحو 278 دولارا.
هذه الأرقام تكشف نقطة مهمة في أمن الذكاء الاصطناعي.
المهاجم لم يعد مضطرا لكتابة مئات المحاولات بنفسه.
يمكنه استخدام نموذج ذكاء اصطناعي لإنشاء الصيغ، تعديلها، اختبارها، ثم الاستمرار تلقائيا حتى يجد طريقة ناجحة.
بمعنى آخر، الذكاء الاصطناعي لا يزيد قدرات المدافع فقط.
هو أيضا يخفض تكلفة الهجوم.
#هل نماذج الذكاء الاصطناعي أقل تنظيما من المطاعم
آدم غليف، الرئيس التنفيذي لـ FAR.AI والمتخصص في سلامة ومواءمة الذكاء الاصطناعي، وصف الوضع بطريقة مباشرة.
قال إن نماذج الذكاء الاصطناعي اليوم أقل خضوعا للتنظيم من المطاعم.
ويرى غليف أن نتائج الاختبار توضح الحاجة إلى معايير خارجية وتنظيمات تفرض على الشركات مستوى محددا من اختبارات السلامة.
من وجهة نظره، الاعتماد فقط على التعهدات الطوعية أو قدرة الشركات على تنظيم نفسها ليس كافيا.
لكن التقرير لا يحمل جانبا تشاؤميا فقط.
النتائج أظهرت أيضا أن اختبار النماذج بشكل منهجي ممكن، وأن بعض النماذج تمكنت بالفعل من مقاومة مجموعة الهجمات المستخدمة.
وهذا يعني أن الدفاع ليس مستحيلا.
المشكلة هي مدى جدية الشركات في تطبيقه.
#Google وAnthropic وOpenAI ترد
روهين شاه، مدير سلامة ومواءمة الذكاء الاصطناعي العام في Google DeepMind، حذر من تفسير النتائج على أنها تقييم شامل لأمان Gemini.
السبب أن جميع حالات الـ Jailbreak ليست متساوية في الخطورة.
بعضها قد ينتج محتوى محدود التأثير، بينما قد يؤدي البعض الآخر إلى نتائج أخطر بكثير.
وأكدت Google أنها تجري اختبارات Red Teaming واسعة، وتقيم مخاطر إساءة الاستخدام، وتطبق عدة طبقات حماية أثناء تطوير النماذج ونشرها.
Anthropic قالت بدورها إن النتائج تعكس استثمارات الشركة المستمرة في أنظمة الحماية، وإن هذه الأنظمة تتطور بالتزامن مع تطور أساليب الهجوم.
أما OpenAI فأكدت أن الـ Jailbreak يمثل تحديا مستمرا على مستوى الصناعة، وأن الشركة تختبر نماذجها باستمرار أمام أساليب هجومية جديدة وتستخدم النتائج لتحسين أنظمة الحماية.
ولم تقدم SpaceXAI ردا على طلب التعليق الذي أرسلته WIRED.
#التنظيم بدأ يدخل المشهد
مع تطور قدرات النماذج، بدأت بعض الولايات الأمريكية في فرض متطلبات جديدة على الشركات المطورة للذكاء الاصطناعي المتقدم.
قوانين أُقرت في كاليفورنيا ونيويورك تطلب من مطوري النماذج المتقدمة نشر تقارير تتعلق بالسلامة.
وفي إلينوي، من المنتظر أن تفرض تشريعات جديدة مراجعة ممارسات السلامة لدى هذه الشركات من جهات تدقيق خارجية.
على المستوى الفيدرالي ما زال المشهد أقل وضوحا.
لا توجد حتى الآن منظومة موحدة تفرض متطلبات سلامة محددة على جميع مطوري النماذج المتقدمة، وهو ما يترك جزءا كبيرا من مسؤولية منع إساءة الاستخدام على عاتق الشركات نفسها.
#عندما يتحول النموذج من أداة إلى طرف في الهجوم
المخاوف لا تتعلق فقط بما قد يكتبه النموذج داخل نافذة محادثة.
الخطر الأكبر يظهر عندما يصبح النموذج قادرا على استخدام أدوات خارجية، تنفيذ أوامر، التعامل مع مستودعات برمجية، أو العمل ضمن Agent يمتلك صلاحيات فعلية.
تقارير حديثة أشارت إلى حوادث وتجارب تمكنت فيها نماذج من التفاعل مع خدمات ومستودعات برمجية بطرق خرجت عن الحدود المتوقعة.
كلما زادت استقلالية الـ Agent، أصبحت أخطاء التوجيه أو ضعف الحواجز الأمنية أكثر خطورة.
النموذج الذي يكتب نصا ضارا يمثل مشكلة.
لكن النموذج الذي يستطيع تنفيذ الأوامر والوصول إلى الأنظمة يمثل مستوى مختلفا تماما من المخاطر.
#الذكاء الاصطناعي والإرهاب
المخاوف لا تتوقف عند الأمن السيبراني.
تقرير صادر عن باحثين في جامعة كامبريدج أشار إلى وجود أدلة على استخدام أفراد مرتبطين بجماعة بوكو حرام في شمال شرق نيجيريا لعدة منصات ذكاء اصطناعي للمساعدة في التخطيط لأعمال عنف.
بحسب التقرير، شملت الأدوات المستخدمة ChatGPT وClaude وGemini وGrok وMeta AI وDeepSeek.
هذه الحالات تعيد النقاش إلى سؤال لم يعد نظريا.
ماذا يحدث عندما تصبح قدرات متقدمة في البرمجة والتحليل والتخطيط متاحة لأي شخص تقريبا بتكلفة منخفضة.
#الحادثة الكبيرة قد لا تكون بعيدة
ستيفن كاسبر، الباحث في علوم الحاسب بجامعة هارفارد، يرى أن مجتمع أبحاث الذكاء الاصطناعي يتعامل بجدية مع احتمال وقوع حوادث خطيرة مرتبطة بالاستخدام السيبراني أو البيولوجي أو الكيميائي للنماذج المتقدمة.
وبرأيه، إذا وقع حادث كبير خلال المستقبل القريب أو المتوسط، فمن المرجح أن يكون مرتبطا بنظام لم يُنشر باستخدام أفضل أنظمة الحماية المتاحة.
المشكلة هنا ليست في وجود نموذج قوي فقط.
المشكلة في نشر نموذج قوي دون طبقات حماية توازي قدراته.
#الحماية موجودة لكن ليست لدى الجميع
أنكا رويل، الباحثة في سياسات الذكاء الاصطناعي بجامعة Stanford، ترى أن أهم ما يكشفه تقرير FAR.AI هو وجود شركات تمكنت بالفعل من مقاومة مجموعة الهجمات المختبرة.
وهذا يعني أن التقنيات الدفاعية موجودة.
السؤال الحقيقي هو لماذا تطبقها بعض الشركات بمستوى أعلى من غيرها.
إذا استطاعت بعض النماذج مقاومة مئات أو آلاف محاولات الـ Jailbreak بينما تفشل نماذج أخرى أمام نفس الأساليب، فإن القضية لم تعد مجرد مشكلة تقنية مفتوحة.
أصبحت أيضا مسألة قرارات هندسية، واستثمار، وحوكمة، ومستوى المخاطر الذي تقبل الشركة أن تتحمله.
#الـ Jailbreak لم يعد مجرد Prompt ذكي
في بدايات نماذج اللغة، كان Jailbreak غالبا عبارة عن Prompt غريب أو لعبة لغوية تحاول إقناع النموذج بتجاهل تعليماته.
اليوم تغير المشهد.
يمكن لنموذج ذكاء اصطناعي أن يهاجم نموذجا آخر.
يمكن توليد آلاف المحاولات تلقائيا.
يمكن قياس النتائج وتحسينها ثم إعادة المحاولة دون تدخل بشري كبير.
وهذا يحول الـ Jailbreak من حيلة يدوية إلى عملية يمكن أتمتتها وتوسيع نطاقها.
المعادلة الأمنية أصبحت أقرب إلى أي مجال آخر في الأمن السيبراني.
المهاجم يبحث عن أضعف نقطة.
المدافع يحاول رفع تكلفة الوصول إليها.
ومن ينجح في جعل الهجوم أغلى وأصعب وأكثر قابلية للكشف، يملك أفضلية حقيقية.
#الخلاصة
نتائج FAR.AI لا تقول إن جميع نماذج الذكاء الاصطناعي غير آمنة.
ولا تقول إن بعض النماذج أصبحت محصنة.
ما تقوله ببساطة هو أن الفارق بين نموذج وآخر في مقاومة محاولات الـ Jailbreak قد يكون كبيرا جدا.
بعض النماذج سقطت أمام مئات المحاولات.
وبعضها صمد أمام نفس مجموعة الاختبارات.
ومع انخفاض تكلفة أتمتة الهجمات، لن يكون السؤال مستقبلا هو ما إذا كان شخص ما سيحاول كسر النموذج.
السؤال سيكون كم محاولة يحتاج إليها، وكم ستكلفه، وهل يستطيع نظام الحماية اكتشافه قبل أن ينجح.
في عالم الذكاء الاصطناعي المتقدم، الحماية لم تعد ميزة إضافية.
أصبحت جزءا من بنية النظام نفسه.



