中文

通过强化学习与奖励建模实现扩散模型的对齐与安全性:综述

计算机视觉与模式识别 2026-05-19 v2

摘要

扩散模型已成为图像和多模态生成的核心范式,但其部署引发了关于对齐、安全性、偏好满足以及对误用的鲁棒性的持续问题。本综述回顾了通过强化学习、奖励建模、偏好优化和安全性特定微调来对齐文本到图像扩散模型的最新进展。我们沿五个轴线组织文献:反馈来源、奖励或偏好信号的形式、优化机制、分布偏移与奖励过优化的处理,以及安全性作为显式约束而非通用偏好的程度。综述涵盖了基于人类反馈的强化学习、KL正则化策略优化、直接偏好优化、二元效用优化、可微奖励微调、代理奖励学习、区域感知微调以及面向安全性的DPO变体。为使综述易于理解,我们包含了扩散采样、奖励建模和偏好优化的教程解释,并简要将图像扩散对齐与新兴的文本和掩码语言扩散模型联系起来。我们还从反馈需求、计算成本、可扩展性、对奖励欺骗的易感性以及安全性关键部署的适用性等方面比较了代表性方法。最后,我们将文献综合为一组开放挑战:多目标对齐、反馈高效偏好学习、对抗鲁棒的安全性对齐、随规范变化的持续对齐以及可解释奖励建模。本综述的目标是为扩散模型对齐这一新兴领域提供连贯的技术图谱,并识别在对齐生成模型能够可靠部署之前必须解决的方法论空白。

关键词

引用

@article{arxiv.2505.17352,
  title  = {Alignment and Safety of Diffusion Models via Reinforcement Learning and Reward Modeling: A Survey},
  author = {Preeti Lamba and Kiran Ravish and Ankita Kushwaha and Pawan Kumar},
  journal= {arXiv preprint arXiv:2505.17352},
  year   = {2026}
}

备注

3 figures, 1 table