prompt injection وjailbreak هما من أكثر تقنيات الهجوم نقاشاً ضد LLM، وكثيراً ما يُخلط بينهما، حتى بين محترفي الأمن. رغم تشابههما، فإنهما يستهدفان أشياء مختلفة، ويحملان مخاطر مختلفة، ويحتاجان دفاعات مختلفة. فهم الفرق ضروري لكل من يعمل في أمن الذكاء الاصطناعي.
ما هو prompt injection؟
prompt injection هجوم على التطبيق المبني فوق نموذج LLM. هدف المهاجم هو تجاوز تعليمات التطبيق (system prompt) وجعل النموذج يفعل شيئاً لم يقصده المطوّر. الهدف هو السلوك المقصود للتطبيق، لا تدريب النموذج على الأمان.
مثلاً، إذا كان روبوت خدمة عملاء مُوجَّهاً لمناقشة المنتجات فقط، فقد يخدعه هجوم prompt injection ليكشف بيانات تسعير داخلية، أو ينفّذ استدعاءات API غير مصرّح بها، أو يتجاهل قواعد العمل. المهاجم يقوّض تعليمات المطوّر، لا محاذاة النموذج على الأمان.
prompt injection مُدرج باسم LLM01:2025 في OWASP Top 10 for LLM Applications. يمكنك استكشاف كيفية عمله عملياً في مختبرات PromptTrace المجانية.
ما هو jailbreak؟
jailbreak هجوم على تدريب النموذج الأساسي على الأمان. هدف المهاجم هو جعل النموذج ينتج محتوى صُمِّمت محاذاته الأمنية (RLHF، أو الذكاء الاصطناعي الدستوري، أو طرق تدريب أخرى) لمنعه، مثل التعليمات الضارة أو خطاب الكراهية أو غيرها من المخرجات غير الآمنة.
يستهدف jailbreak النموذج نفسه، بغضّ النظر عن التطبيق الذي يغلّفه. jailbreak الذي ينجح على ChatGPT سينجح غالباً على أي تطبيق آخر يستخدم النموذج الأساسي نفسه، لأن الثغرة في تدريب النموذج، لا في prompt التطبيق.
الفروق الأساسية
تتلخّص الفروق بين prompt injection وjailbreak في خمسة أبعاد رئيسية:
الجهة المستهدفة
prompt injection يستهدف طبقة التطبيق: system prompt، ومنطق العمل، والسلوك الذي يحدده المطوّر. jailbreak يستهدف طبقة النموذج: تدريب الأمان والمحاذاة المبنية داخل LLM نفسه.
هدف المهاجم
prompt injection يسعى لجعل النموذج يتجاهل تعليمات المطوّر وينفّذ أفعالاً غير مصرّح بها (تسريب البيانات، tool calling، تجاوز قواعد العمل). jailbreak يسعى لجعل النموذج ينتج محتوى دُرِّب على رفضه (معلومات ضارة، مخرجات غير آمنة).
من الضحية؟
في prompt injection، الضحية عادة هو مالك التطبيق أو مستخدموه؛ فالهجوم يقوّض سلامة التطبيق. في jailbreak، «الضحية» هو سياسات الأمان لدى مزوّد النموذج؛ فالمهاجم يريد أن يتجاهل النموذج guardrails الخاصة بتدريبه.
التقنيات
prompt injection يستخدم تقنيات مثل «تجاهل التعليمات السابقة»، والحقن غير المباشر عبر المستندات، والتلاعب بالسياق، وإساءة استخدام الأدوات. jailbreak يستخدم تقنيات مثل سيناريوهات تقمّص الأدوار (DAN)، والتأطير الافتراضي («في عالم خيالي حيث...»)، والهجمات الخصمية على مستوى tokens. هناك تداخل كبير؛ فكثير من التقنيات تعمل للنوعين.
الخطورة والأثر
prompt injection يُعتبر عموماً أخطر في سياقات المؤسسات لأنه قد يؤدي إلى تسريب البيانات وأفعال غير مصرّح بها وخسارة مالية. jailbreak يؤدي أساساً إلى مخالفة السياسات وتوليد محتوى ضار. يدرج OWASP prompt injection باسم LLM01:2025؛ وهذا معرّف للفئة لا ترتيب رقمي للمخاطر.
أين يتداخلان
عملياً، كثيراً ما يتداخل prompt injection وjailbreak. فهجوم تقمّص الأدوار («تظاهر بأنك DAN») قد يُحقّق jailbreak لتدريب النموذج على الأمان ويتجاوز system prompt الخاص بالتطبيق في آنٍ واحد. كثير من الهجمات الواقعية تجمع عناصر من كليهما؛ فالمهاجم لا يهتم بالتصنيف، بل بالنتيجة فقط.
لترى ذلك عملياً، استكشف كيف يستجيب The Bare LLM دون أي دفاعات على مستوى التطبيق. ثم قارن ذلك السلوك بالنماذج ذات الدفاعات النشطة؛ سترى كيف يمكن للتقنية نفسها أن تستهدف طبقات مختلفة حسب السياق.
تصنيف OWASP
تصنّف OWASP Top 10 for LLM Applications prompt injection (LLM01:2025) على أنه متميّز عن بقية المخاطر. أما jailbreak فليس له فئة منفصلة خاصة به؛ فهو يُعتبر جزءاً أو تقنية ذات صلة. يعامل هذا prompt injection على مستوى التطبيق، الذي قد يسبّب ضرراً تجارياً مباشراً، كفئة مخاطر منفصلة لا كأولوية رقمية. وتصنّف منظومة MITRE ATLAS كليهما كتقنيتين هجوميتين، مع تناول أكثر تفصيلاً لـ prompt injection بسبب اتّساع سطح أثره.
لماذا يهم هذا للمدافعين
إذا كنت تدافع ضد prompt injection، فتركيزك على معمارية التطبيق: system prompts قوية، وترشيح المدخلات والمخرجات، ووصول الأدوات بالصلاحية الأدنى (least privilege)، والمراقبة. أما إذا كنت تدافع ضد jailbreak، فتركيزك على المحاذاة وتدريب الأمان على مستوى النموذج، وهذا أساساً مسؤولية مزوّد النموذج.
معظم المطوّرين يحتاجون إلى التركيز على الدفاع ضد prompt injection، لأنهم يتحكّمون في طبقة التطبيق لا في تدريب النموذج. تساعدك ميزة Context Trace في PromptTrace على فحص كيفية تجميع طبقات prompt التي تُعرض للاعب، مما يسهّل تحديد المكان الذي قد تدخل منه هجمات prompt injection؛ وقد تُحجب أسرار التحدّي والقيم الحسّاسة. تدرّب على النوعين مجاناً في المختبرات والتحدّي لتبني حدساً لكيفية اختلافهما عملياً.