中文

面向扩散模型的双重描述偏好优化

计算机视觉与模式识别 2025-10-21 v2

摘要

近期,最初为大型语言模型 (LLM) 开发的人类偏好优化方法在改进文本到图像扩散模型方面显示出巨大潜力。这些方法旨在学习偏好样本的分布,同时将其与较不偏好的样本区分开来。然而,在现有的偏好数据集中,原始描述通常不能明确地表明偏好图像优于替代图像,这削弱了训练期间可用的监督信号。为了解决这个问题,我们引入了双重描述偏好优化 (DCPO),这是一种数据增强和优化框架,通过为每个偏好对分配两个不同的描述来强化学习信号。这鼓励模型在训练期间更好地区分偏好和较不偏好的结果。我们还构建了 Pick-Double Caption,这是 Pick-a-Pic v2 的一个修改版本,为每个图像提供单独的标题,并提出了三种生成不同描述的不同策略:描述、扰动和混合方法。我们的实验表明,DCPO 显著提高了图像质量和与提示的相关性,在多个指标上优于 Stable Diffusion (SD) 2.1、SFT_Chosen、Diffusion-DPO 和 MaPO,包括 Pickscore、HPSv2.1、GenEval、CLIPscore 和 ImageReward,并以 SD 2.1 作为骨干网络进行微调。

关键词

引用

@article{arxiv.2502.06023,
  title  = {Dual Caption Preference Optimization for Diffusion Models},
  author = {Amir Saeidi and Yiran Luo and Agneet Chatterjee and Shamanthak Hegde and Bimsara Pathiraja and Yezhou Yang and Chitta Baral},
  journal= {arXiv preprint arXiv:2502.06023},
  year   = {2025}
}