中文

组合式越狱:对已对齐 LLM 中变异器链交互的实证分析

密码学与安全 2026-05-18 v1 软件工程

摘要

针对大语言模型的越狱攻击通过生成有害或受限内容,对人工智能安全构成重大威胁。尽管先前的工作探索了手工和自动化的越狱策略,但简单攻击之间组合交互的潜力仍未得到充分研究。本文对变异器链进行了系统性研究,其中弱越狱变换被顺序应用,以刻画它们如何交互:它们是相互增强、破坏性干扰,还是不产生有意义的变化。我们实现了十二个基线变异器,并在一个有害提示基准上针对三个流行的 LLM 模型评估了所有有序对。我们的框架引入了完整性和有效性的度量指标,以捕捉变换的持久性和攻击的有效性。结果表明,交互景观高度非均匀,虽然大多数组合未能超越单个变异器,表现出破坏性干扰或结构不兼容,但有一小部分产生了协同效应,提高了攻击成功率。同样重要的是,普遍的失败模式揭示了安全对齐的结构特性,这些特性在单一策略评估中并不明显。这些发现凸显了对抗性提示组合的细微动态,并为构建更稳健的安全防御提供了新的见解。

关键词

引用

@article{arxiv.2605.15598,
  title  = {Compositional Jailbreaking: An Empirical Analysis of Mutator Chain Interactions in Aligned LLMs},
  author = {Reinelle Jan Bugnot and Soohyeon Choi and Hoon Wei Lim and Yue Duan},
  journal= {arXiv preprint arXiv:2605.15598},
  year   = {2026}
}

备注

16 pages, 7 figures, 3 tables