中文

更安全的扩散模型,因上下文被破坏:扩散型大语言模型的安全祝福及其失效模式

机器学习 2026-04-03 v2

摘要

扩散大语言模型(D-LLMs)提供了一种对自回归大语言模型(AR-LLMs)的替代方案,已在生成效率方面展现出优势。除了实用性收益之外,我们认为D-LLMs表现出一种此前未被充分探索的安全祝福:其扩散式生成为针对AR-LLMs设计的越狱攻击提供了内在鲁棒性。在本工作中,我们提供了对其背后机制的初始分析,表明扩散轨迹引发逐步降低效应,逐渐抑制不安全的生成。然而,这种鲁棒性并非绝对。随着这一分析,我们指出一种简单而有效的失效模式,即上下文嵌套, wherein 有害请求被嵌入结构化的良性上下文中。经验上,我们展示了这一简单的黑盒策略能够绕过D-LLMs的安全祝福,在模型和基准测试中实现最高的攻击成功率。值得注意的是,它使我们了解到的第一个成功的Gemini Diffusion越狱暴露了专有D-LLMs中的关键漏洞。总之,我们的结果刻画了D-LLMs安全祝福的来源及其局限,构成了D-LLMs的早期红队测试。

关键词

引用

@article{arxiv.2602.00388,
  title  = {Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode},
  author = {Zeyuan He and Yupeng Chen and Lang Lin and Yihan Wang and Shenxu Chang and Eric Sommerlade and Philip Torr and Junchi Yu and Adel Bibi and Jialin Yu},
  journal= {arXiv preprint arXiv:2602.00388},
  year   = {2026}
}