تقنيات كسر حماية الذكاء الاصطناعي: DAN وتقمّص الأدوار والترميز والهجمات متعددة الأدوار

بقلم عبدالرحمن عادل|11 دقيقة قراءة

كسر حماية الذكاء الاصطناعي (jailbreak) هو أي مدخل يدفع النموذج اللغوي إلى تجاوز تدريبه على الأمان وإنتاج محتوى بُني ليرفضه. يتداخل كسر الحماية مع الـ prompt injection لكن الهدف مختلف: الـ prompt injection يخطف تعليمات التطبيق، بينما كسر الحماية يستهدف حواجز أمان النموذج نفسه. يشرح هذا الدليل العائلات الرئيسية لتقنيات كسر الحماية، ولماذا تنجح كلٌّ منها، وكيف تدافع. وكل تقنية هنا لها مدخل عملي في ورقة مرجع الـ prompt injection.

لماذا ينجح كسر الحماية أصلاً

الأمان في النموذج اللغوي سلوك مُتعلَّم، وليس قاعدة مفروضة. دُرِّب النموذج على رفض طلبات معيّنة، لكن هذا الرفض ميل إحصائي وليس حدّ صلاحية صارماً. يبحث كسر الحماية عن صياغة يفوق فيها تدريب النموذج على المساعدة تدريبَه على الرفض. لهذا يمكن للطلب نفسه، بصياغة مختلفة، أن ينقلب من مرفوض إلى مُجاب. فهم هذا التوتر هو مفتاح الهجوم والدفاع معاً.

كسر الحماية بتقمّص الأدوار والشخصيات (DAN وأشباهه)

أشهر عائلة تطلب من النموذج أن يؤدي شخصية بلا قيود. المثال الكلاسيكي هو DAN، اختصار «Do Anything Now»، شخصية يعرّفها المستخدم كذكاء اصطناعي متحرّر من القواعد المعتادة. تخبر بعض التنويعات النموذجَ بأنه شخصية خيالية، أو مساعد بحثي بلا فلاتر، أو نظام في «وضع المطوّر».

تنجح هذه الحيل لأن النموذج يتعامل مع الطلب كمهمّة كتابة إبداعية لا كسؤال عن السياسات. وبتغليف الطلب الضار داخل قصة أو شخصية، ينقل المهاجمُ النموذجَ إلى وضع يبدو فيه الرفض خروجاً عن الشخصية. تقاوم النماذج الحديثة أمر DAN المجرّد، لذا تدمجه المحاولات الحقيقية مع تقنيات أخرى أدناه.

انتحال الصلاحية والتأطير

تتلاعب هذه العائلة بالسياق الذي يستدل عليه النموذج. تشمل الأنماط الشائعة ادّعاء أنك مطوّر أو باحث أمني يحتاج المحتوى المقيَّد للاختبار، أو التأكيد أن سياسةً تغيّرت، أو تأطير الطلب الضار على أنه ضروري لمنع ضرر أكبر. وثمة تنويع يُدرج رسائل نظام مزيّفة، أي نصاً يبدو كمجموعة جديدة من تعليمات المطوّر.

تنجح هجمات التأطير حين لا يستطيع النموذج التحقق من الادّعاء. فهو لا يملك وسيلة للتأكد من أنك فعلاً مختبِر أمان، لذا يمكن لادّعاء واثق ومُحكم البناء أن يميل باستجابته. يقلّل تدريب تسلسل التعليمات من ذلك لكنه لا يزيله.

الترميز والتشويش

بدل إقناع النموذج، تُخفي هذه العائلة الطلب عن الفلاتر التي تحرسه. تُرمَّز الكلمات الضارة (Base64، hex، ROT13)، أو تُموَّه بحروف شبيهة (المحارف المتشابهة)، أو تُخفى بـ محارف عديمة العرض. يرى فلتر الكلمات المفتاحية أو المصنِّف حروفاً بلا معنى، بينما يظل النموذج يفكّ الترميز ويتصرّف بناءً على المحتوى.

يمكنك إعادة إنتاج كل هذه الترميزات في Reveal Trace، أداتنا المجانية للترميز وفكّه، ورؤية ما يستقبله النموذج مقابل ما يراه الفلتر الساذج. هذه أكثر عائلات كسر الحماية قابليةً للنقل، لأنها تهاجم الدفاع لا النموذج.

الهجمات متعددة الأدوار والتصاعدية

بدل طلب المحتوى المقيَّد مباشرة، يبنيه الهجوم متعدد الأدوار عبر عدة رسائل. كل دور غير ضار بمفرده فلا تُشغِّل أيُّ رسالة منفردة فلتراً، لكنها مجتمعة تقود النموذج نحو الهدف. يبدأ النمط التصاعدي بنسخة بريئة من الموضوع ثم يتصاعد تدريجياً مستخدماً إجابات النموذج السابقة نفسها كتبرير للخطوة التالية.

تنجح هذه الهجمات لأن معظم فحوص الأمان تقيّم رسالة واحدة في كل مرة. أما الدفاع ضدها فيتطلب الاستدلال على المحادثة كاملة، وهو أصعب وأكثر كلفة.

استغلال الاستدلال والتعليمات

تستهدف هذه العائلة طريقة تفكير النموذج. تشمل التقنيات مطالبة النموذج بالاستدلال خطوة بخطوة حتى يتجاوز قاعدةً بنفسه، أو تقسيم كلمة محظورة عبر عدة رموز (tokens) لتفوت الفلاتر، أو إثقال النموذج بتعليمات متشعّبة معقّدة حتى تُسقَط فحوص الأمان، أو استغلال الحدّ بين الـ system prompt ومدخل المستخدم بفواصل خاصة. تظهر هذه في ورقة المرجع ضمن فئتَي الاستدلال والتجاوز.

كيف تدافع ضد كسر الحماية

لا يوجد ضابط واحد يوقف كل كسر حماية، لذا الدفاع طبقي. تشمل الإجراءات العملية تسلسل تعليمات قوياً تفوق فيه رسائل المطوّر محتوى المستخدم، ومصنِّفات إدخال وإخراج تُطبِّع النص وتفكّ ترميزه قبل فحصه، وتقييد الأدوات والبيانات التي يصل إليها النموذج حتى يقلّ ما يمكن أن يستغلّه كسرُ حماية ناجح، وتقييم المحادثة كاملة لا الأدوار المنفردة. تشرح وحدة دفاعات الـ LLM لماذا يساعد كل دفاع وأين يفشل.

تدرّب على نماذج حقيقية

القراءة عن كسر الحماية ليست كتنفيذه. في مختبرات PromptTrace المجانية تجرّب هذه التقنيات ضد نماذج لغوية حقيقية وتشاهد الـ Context Trace يوضّح لماذا تنجح كل محاولة أو تفشل. وحين تستعدّ للتحدّي، يرفع الـ Gauntlet مستوى الدفاعات مستوى بعد مستوى. ابدأ من ورقة المرجع للاطّلاع على القائمة الكاملة للتقنيات والـ payloads.