中文

Chain-of-Lure:一种使用无约束合成叙事的通用越狱攻击框架

密码学与安全 2026-03-03 v3 计算与语言

摘要

在生成式AI快速发展的时代,与大语言模型(LLMs)的交互带来了日益增加的滥用风险。先前的研究主要关注使用模板化提示和优化导向方法的攻击,而忽视了LLMs具有强大的无约束欺骗能力来攻击其他LLMs这一事实。本文提出了一种受思维链机制启发的新型越狱方法。攻击者利用任务迁移将有害用户意图隐藏在对话中,并生成渐进式的诱饵问题链,无需依赖预定义模板,从而实现成功的越狱。为进一步提高攻击强度,我们引入了一个辅助LLM模型,在多轮交互中执行随机叙事优化,在保持与原始意图对齐的同时增强攻击性能。我们还提出了一个基于毒性的框架,利用第三方LLMs评估有害内容及其与恶意意图的一致性。大量实验表明,我们的方法在各种类型的LLMs的黑盒API设置下始终实现了高攻击成功率和升高的毒性分数。这些发现揭示了LLMs在缺乏稳健对齐约束的情况下执行不受限制攻击的内在潜力。我们的方法为未来对齐机制的设计提供了数据驱动的见解。最后,我们提出了两种具体的防御策略以支持更安全生成式模型的发展。我们的代码可在 https://github.com/ChangWenhan/chain-of-lure-official 获取。

关键词

引用

@article{arxiv.2505.17519,
  title  = {Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives},
  author = {Wenhan Chang and Tianqing Zhu and Yu Zhao and Shuangyong Song and Ping Xiong and Wanlei Zhou},
  journal= {arXiv preprint arXiv:2505.17519},
  year   = {2026}
}

备注

23 pages, 3 main figures