中文

面向扩散模型对齐的校准化多偏好优化

计算机视觉与模式识别 2025-09-29 v3

摘要

将文本到图像(T2I)扩散模型与偏好优化对齐对于人工标注数据集很有价值,但人工数据收集的高昂成本限制了其可扩展性。使用奖励模型提供了一种替代方案,然而,当前的偏好优化方法仅考虑成对偏好分布,未能充分利用其中的丰富信息。此外,它们缺乏对多偏好场景的泛化能力,并且难以处理奖励之间的不一致性。为解决这些问题,我们提出了校准化偏好优化(CaPO),这是一种无需人工标注数据,通过整合来自多个奖励模型的通用偏好来对齐 T2I 扩散模型的新方法。我们方法的核心涉及一种奖励校准方法,通过计算相对于预训练模型生成样本的期望胜率来近似通用偏好。此外,我们提出了一种基于前沿的配对选择方法,通过从帕累托前沿选择配对来有效管理多偏好分布。最后,我们使用回归损失微调扩散模型,以匹配所选配对的校准奖励之间的差异。实验结果表明,在 GenEval 和 T2I-Compbench 等 T2I 基准测试的评估中,CaPO 在单奖励和多奖励设置下均持续优于先前的方法,如直接偏好优化(DPO)。

关键词

引用

@article{arxiv.2502.02588,
  title  = {Calibrated Multi-Preference Optimization for Aligning Diffusion Models},
  author = {Kyungmin Lee and Xiaohang Li and Qifei Wang and Junfeng He and Junjie Ke and Ming-Hsuan Yang and Irfan Essa and Jinwoo Shin and Feng Yang and Yinxiao Li},
  journal= {arXiv preprint arXiv:2502.02588},
  year   = {2025}
}

备注

CVPR 2025, Project page: https://kyungmnlee.github.io/capo.github.io/