中文

GDPO-SR:用于单步生成图像超分辨率的群直接偏好优化

计算机视觉与模式识别 2026-03-18 v1

摘要

最近,强化学习(RL)被用于提高生成式图像超分辨率(ISR)性能。然而,当前努力主要聚焦于多步生成ISR,而单步生成ISR鲜有探索,由于其受限的随机性。此外,RL方法如直接偏好优化(Direct Preference Optimization, DPO)需要离线生成正负样本对,导致样本数量有限;而群相对政策优化(Group Relative Policy Optimization, GRPO)仅计算整个图像的似然性,忽略了对于ISR至关重要的局部细节。在本文中,我们提出了群直接偏好优化(Group Direct Preference Optimization, GDPO),一种将RL集成到单步生成ISR模型训练中的新方法。首先,我们引入一种噪声感知的单步扩散模型,可生成多样化的ISR输出。为防止噪声注入导致性能下降,我们引入不等时刻策略,将噪声添加的时刻与扩散的时刻解耦。随后,我们提出GDPO策略,将GRPO的原理引入DPO,以计算每个在线生成样本的群相对优势,以进行模型优化。同时,设计了基于平滑区域和纹理区域统计信息的属性感知奖励函数,以动态评估每个样本的得分。实验表明,GDPO在增强单步生成ISR模型性能方面有效。

关键词

引用

@article{arxiv.2603.16769,
  title  = {GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution},
  author = {Qiaosi Yi and Shuai Li and Rongyuan Wu and Lingchen Sun and Zhengqiang Zhang and Lei Zhang},
  journal= {arXiv preprint arXiv:2603.16769},
  year   = {2026}
}