中文

FinPercep-RM:基于 RL 的面向真实世界超分辨率的细粒度奖励模型与共进化课程

计算机视觉与模式识别 2026-04-07 v2

摘要

基于人类反馈的强化学习 (RLHF) 在图像生成领域已证明有效,利用奖励模型引导人类偏好。在此基础上,将 RLHF 应用于图像超分辨率 (ISR) 任务显示出以图像质量评估 (IQA) 模型作为奖励模型优化感知质量的潜力。然而,传统 IQA 模型仅输出单一全局评分,对局部和细粒度失真极其不敏感,这种不敏感性使 ISR 模型能够产生感知上不可接受的伪影,获得虚高的评分,从而使优化目标与感知质量错位,导致奖励黑客。为此,我们提出基于 Encoder-Decoder 架构的细粒度感知奖励模型 (FinPercep-RM),它在提供全局质量评分的同时,还生成感知退化图 (Perceptual Degradation Map),对局部缺陷进行空间局部化和量化。我们专门构建 FGR-30k 数据集进行模型训练,该数据集包含来自真实 ISR 模型的多样且细微失真。尽管 FinPercep-RM 模型取得成功,但其复杂度为生成器策略学习带来了显著挑战,导致训练不稳定。为此,我们提出共进化课程学习 (CCL) 机制,使奖励模型和 ISR 模型同步演化:奖励模型逐步增加复杂度,而 ISR 模型则从简单的全局奖励开始,以实现快速收敛,逐渐过渡到更复杂的模型输出。这种由易到难的策略实现了稳定训练,抑制了奖励黑客。实验结果在 ISR 模型的全局质量和局部真实感方面验证了本方法在 RLHF 方法中的有效性。

关键词

引用

@article{arxiv.2512.22647,
  title  = {FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution},
  author = {Yidi Liu and Zihao Fan and Jie Huang and Jie Xiao and Dong Li and Wenlong Zhang and Lei Bai and Xueyang Fu and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2512.22647},
  year   = {2026}
}

备注

Accepted by CVPR2026