中文

面具背后的恶魔:扩散 LLM 的一种新兴安全漏洞

计算与语言 2026-02-11 v2

摘要

扩散型大语言模型(dLLMs)近期作为自回归 LLM 的强有力替代品,凭借并行解码和双向建模提供了更快的推理速度和更高的交互性。尽管在代码生成和文本填充方面表现优异,但我们发现了一个根本性的安全问题:现有的对齐机制未能保护 dLLMs 免受面具输入对抗提示的攻击,从而暴露了新的漏洞。为此,我们提出 DIJA,即首个系统性研究和越狱攻击框架,旨在利用 dLLMs 的独特安全弱点。具体而言,我们的 DIJA 构建包含挑战性掩码-文本交错提示的对抗性输入,利用 dLLMs 的文本生成机制,即双向建模和并行解码。双向建模驱动模型为掩码区域产生情境一致的输出,即使在有害内容也如此;而并行解码限制了模型对不安全内容的动态过滤和拒绝采样,从而导致标准对齐机制失效,使得即使在对齐调优的 dLLMs 中,当提示中直接暴露有害行为或不安全指令时,也仍可生成有害完成。通过全面实验,我们展示 DIJA 在越狱方法方面显著优于现有方法,揭示了 dLLM 架构中此前被忽视的威胁表面。值得注意的是,我们的方法在 Dream-Instruct 上实现最高达100%的关键词基准成功率,在 JailbreakBench 上相较于最强的先前基线 ReNeLLM 提升最高达78.5%的评估者基准成功率,在 StrongREJECT 分数上提升37.7分,而且无需对越狱提示中的有害内容进行重写或隐藏。我们的发现凸显了对这一新兴语言模型类别进行安全对齐的紧迫需求。代码已公开于 https://github.com/ZichenWen1/DIJA

关键词

引用

@article{arxiv.2507.11097,
  title  = {The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs},
  author = {Zichen Wen and Jiashu Qu and Zhaorun Chen and Xiaoya Lu and Dongrui Liu and Zhiyuan Liu and Ruixi Wu and Yicun Yang and Xiangqi Jin and Haoyun Xu and Xuyang Liu and Weijia Li and Chaochao Lu and Jing Shao and Conghui He and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2507.11097},
  year   = {2026}
}

备注

Accepted by ICLR 2026