中文

超越成对偏好:扩散模型的列表式奖励感知对齐

机器学习 2026-05-27 v1 计算机视觉与模式识别

摘要

偏好优化已成为在线人类反馈强化学习(RLHF)的一种高效替代方案,用于对齐文生图扩散模型。然而,现有方法大多将监督信号简化为二元成对比较。当训练数据自然包含同一提示的多个候选图像,并且连续奖励分数能提供比单一胜者-败者标签更丰富的信息时,这种成对简化就具有局限性。为解决这些局限性,我们提出了Diffusion LAIR,一种用于扩散模型的奖励感知列表式偏好优化方法。对于每个提示,LAIR将一组候选图像的奖励分数转换为中心化优势权重,然后对隐式奖励优化一个优势加权回归目标,该隐式奖励定义为当前模型相对于固定参考模型的去噪损失改进,并带有一个二次惩罚项来正则化隐式奖励的幅度。由此产生的目标函数同时利用所有候选图像,而非选择配对,并通过显式控制隐式奖励的幅度来保持保守性。LAIR目标函数在隐式奖励空间中具有有界闭式最优解,阐明了正则化强度如何控制偏好更新的幅度。实验表明,Diffusion LAIR在SD1.5和SDXL上,在文生图、组合生成和图像编辑基准测试中均优于强偏好优化基线方法。

关键词

引用

@article{arxiv.2605.26491,
  title  = {Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models},
  author = {Austin Wang and Jiaqi Han and Stefano Ermon and Yisong Yue},
  journal= {arXiv preprint arXiv:2605.26491},
  year   = {2026}
}