MIRA:缓解扩散模型在推理时对齐中的奖励入侵
机器学习
2025-10-03 v1
摘要
扩散模型在以文本提示生成图像方面表现出色,但生成的图像常不满足由标量奖励(如审美评分)衡量的用户特定标准. 这种对齐通常需要微调,但计算成本高昂. 最近,一种通过噪声优化实现推理时对齐的做法作为一种有效替代方案,修改初始输入噪声以引导扩散去噪过程生成高奖励图像. 然而,这种方法受到奖励入侵的困扰,即模型生成的图像得分高,但显著偏离原始提示. 我们表明噪声空间的正则化不足,防止奖励入侵需要显式的图像空间约束. 为此,我们提出 MIRA(MItigating Reward hAcking),一种无训练的推理时对齐方法. MIRA 引入一种基于得分的图像空间 KL 近似,用于冻结 backbone 的采样轨迹进行正则化,约束输出分布,使奖励能够在不产生离分布漂移(奖励入侵)的情况下增加. 我们推导了使用扩散得分的可行 KL 近似. 在 SDv1.5 和 SDXL 上,针对多个奖励(Aesthetic、HPSv2、PickScore)以及公开数据集(如 Animal-Animal、HPDv2),MIRA 对强基准以上的 >60% 获胜率,同时保持提示遵循;机制图显示奖励提升幅度接近于零,而 DNO 在计算量增加时会产生漂移. 我们进一步引入 MIRA-DPO,将偏好优化映射到推理时间,采用冻结 backbone,将 MIRA 扩展到非可微奖励,无需微调即可实现.
引用
@article{arxiv.2510.01549,
title = {MIRA: Towards Mitigating Reward Hacking in Inference-Time Alignment of T2I Diffusion Models},
author = {Kevin Zhai and Utsav Singh and Anirudh Thatipelli and Souradip Chakraborty and Anit Kumar Sahu and Furong Huang and Amrit Singh Bedi and Mubarak Shah},
journal= {arXiv preprint arXiv:2510.01549},
year = {2025}
}