何处开始对齐?扩散大语言模型可能需要独特的位置
密码学与安全
2025-11-27 v2 人工智能
计算与语言
摘要
扩散大语言模型(Diffusion Large Language Models,dLLMs)因其独特的训练与推理方式,最近作为竞争性非自回归范式而逐渐崭露头角。然而,目前缺乏对该新型架构的安全性研究。在本文中,我们首次分析 dLLMs 的安全性能,并提出一种针对其独特生成特征的新型安全对齐方法。具体而言,我们识别了防御者与攻击者在安全方面存在的关键不对称性。对于防御者而言,我们发现响应的中间 token 而非初始几个 token 对 dLLM 输出的整体安全性更为关键;这似乎暗示了对中间 token 进行对齐对防御者更有益。攻击者方面,则发现 dLLMs 在实践中倾向于顺序生成,迫使攻击必须满足该分布,从而使其难以影响关键的中间 token。基于这种不对称性,我们引入了 Middle-tOken Safety Alignment(MOSA)方法,直接通过强化学习对齐模型的中间生成以实现安全拒绝。我们实现了 MOSA 并将其安全性能与八种攻击方法在两个基准测试上进行比较。我们还测试了 MOSA 对齐的 dLLM 在编码、数学和一般推理任务中的实用性。结果强有力地证明了 MOSA 的优越性。
引用
@article{arxiv.2508.12398,
title = {Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position},
author = {Zhixin Xie and Xurui Song and Jun Luo},
journal= {arXiv preprint arXiv:2508.12398},
year = {2025}
}
备注
Accepted for oral presentation at AAAI 2026