中文

逐词生成:增量补全分解突破 LLM 安全机制

计算与语言 2026-04-30 v1 密码学与安全

摘要

大语言模型(LLM)被训练以拒绝有害请求,但它们仍然容易受到越狱攻击,这些攻击利用了对话安全机制中的弱点。我们引入了增量补全分解(ICD),这是一种基于轨迹的越狱策略,在引出完整回复之前,先引出与恶意请求相关的一系列单词续写。此外,我们通过手动挑选或模型生成单词续写,以及在最后一步引出完整模型回复时使用预填充,提出了 ICD 的变体。我们在广泛的模型家族中系统地评估了这些变体,证明了在 AdvBench、JailbreakBench 和 StrongREJECT 上,相较于现有方法具有更优的攻击成功率(ASR)。此外,我们提供了 ICD 为何有效的理论解释,并提出了机制证据,表明成功的攻击轨迹系统性地抑制了与拒绝相关的表示,并将激活状态推离安全对齐状态。

关键词

引用

@article{arxiv.2604.25921,
  title  = {One Word at a Time: Incremental Completion Decomposition Breaks LLM Safety},
  author = {Samee Arif and Naihao Deng and Zhijing Jin and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2604.25921},
  year   = {2026}
}