中文

提升越狱策略:一种集成 LLM 漏洞与绕过现代防御的混合方法

计算与语言 2025-06-30 v1 人工智能 密码学与安全 机器学习

摘要

预训练语言模型(PTLMs)和大型语言模型(LLMs)的不断进步导致其在 diverse 应用领域广泛采用。尽管取得了成功,但这些模型仍然 vulnerable to 那些利用其内在弱点来绕过安全措施的攻击。令牌级和提示级是两类主要的推理阶段威胁。令牌级攻击嵌入对抗序列,这些序列在像 GPT 这样的黑盒模型中传输效果良好,但留下可检测的模式,依赖于基于梯度的 token 优化;而提示级攻击则使用语义结构化的输入来诱导有害响应,但依赖于可靠性较差的迭代反馈。为解决这些方法的互补局限性,我们提出了两种混合方法,将 token 级和提示级技术集成以提升针对 diverse PTLMs 的越狱效果。我们评估了 GCG + PAIR 和新探索的 GCG + WordGame 混合方法在多个 Vicuna 和 Llama 模型上的表现。实验表明,GCG + PAIR 在 undefended 模型上 consistently 将攻击成功率提升至 91.6%,显著高于 PAIR 的 58.4% 基准;而 GCG + WordGame 能匹配 WordGame 的原始性能,在更严苛的评估器(如 Mistral-Sorry-Bench)下仍保持超过 80% 的攻击成功率。关键的是,这两种混合方法都保留了 transferability,可靠地突破如 Gradient Cuff 和 JBShield 等高级防御,这些防御完全阻止了单模式攻击。这些发现揭示了当前安全堆栈中此前未报告的漏洞,凸显了 raw success 与防御鲁棒性之间的权衡,并强调了针对适应性对手的全面防御的必要性。

关键词

引用

@article{arxiv.2506.21972,
  title  = {Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses},
  author = {Mohamed Ahmed and Mohamed Abdelmouty and Mingyu Kim and Gunvanth Kandula and Alex Park and James C. Davis},
  journal= {arXiv preprint arXiv:2506.21972},
  year   = {2025}
}