面向文本扩散模型的安全感知去噪器
机器学习
2026-05-12 v1 人工智能
摘要
近期的文本扩散模型工作为自回归生成提供了一条有前景的替代路径,但其安全控制仍未得到充分探索。现有的安全方法面向自回归模型,通常依赖事后过滤或推理时的干预,这些方法对于有效应对文本扩散模型中的安全风险不够。我们提出了安全感知去噪器(Safety-Aware Denoiser, SAD),这是一种面向文本扩散模型的安全指导框架。SAD 修改迭代去噪过程,使得最终去噪步骤后的文本样本被引导至文本空间中可被证明的安全区域。该方法在推理阶段集成安全约束,无需对底层扩散模型进行计算密集的重新训练,即可实现灵活、轻量级的安全指导。我们使用 SAD 对生成文本的安全性进行评估,依据危险分类、记忆痕迹和越狱三方面进行测试。实验结果表明,SAD 在保持生成质量、多样性和流畅度的同时,显著降低了不安全生成的概率,超越了现有方法。这表明我们在去噪期间的安全指导为强制执行文本扩散模型安全性提供了有效且可扩展的机制。
引用
@article{arxiv.2605.08116,
title = {The Safety-Aware Denoiser for Text Diffusion Models},
author = {Amman Yusuf and Zhejun Jiang and Mijung Park},
journal= {arXiv preprint arXiv:2605.08116},
year = {2026}
}
备注
27 pages, 12 figures. Code available at: https://github.com/ammanyusuf/SAD