越狱模仿:自动发现大型语言模型的叙事型越狱
密码学与安全
2025-10-28 v1 人工智能
计算与语言
机器学习
摘要
大型语言模型 (LLM) 仍然对利用情境框架规避安全机制的高级提示工程攻击保持脆弱态度,这在网络安全应用中构成重大风险。我们引入越狱模仿 (Jailbreak Mimicry),一种系统性方法,用于训练紧凑型攻击模型以自动生成一次性叙事型越狱提示。我们的做法将对抗性提示发现从手动工艺转变为可重复的科学过程,使其能够在 AI 驱动的安全系统中实现主动性漏洞评估。为完成 OpenAI GPT-OSS-20B Red-Teaming Challenge,我们在 Mistral-7B 上使用来自 AdvBench 的精选数据集进行参数高效微调 (LoRA),在 200 项测试集上实现 81.0% 攻击成功率 (ASR)。跨模型评估显示漏洞模式存在显著差异:我们的攻击在 GPT-4 上达到 66.5% ASR,在 Llama-3 上达到 79.5%,对 Gemini 2.5 Flash 仅达 33.0%,显示出在网络安全情境中具备广泛适用性以及模型特定的防御优势。这比直接提示 (1.5% ASR) 高出 54 倍,证明了当前安全对齐方法中的系统性漏洞。我们的分析显示,技术领域(网络安全:93% ASR)和欺骗性攻击(诈骗:87.8% ASR)尤其脆弱,凸显了针对 AI 集成威胁检测、恶意软件分析和安全系统的威胁。我们采用 Claude Sonnet 4 进行自动化有害性评估,并与人类专家评估交叉验证,确保网络安全红队测试中可靠且可扩展的评估。最后,我们分析了失效机制并讨论了缓解这些漏洞的防御策略。
引用
@article{arxiv.2510.22085,
title = {Jailbreak Mimicry: Automated Discovery of Narrative-Based Jailbreaks for Large Language Models},
author = {Pavlos Ntais},
journal= {arXiv preprint arXiv:2510.22085},
year = {2025}
}
备注
18 pages, 5 figures