中文

RefReward-SR:基于 LR 条件奖励建模的偏好对齐超分辨方法

计算机视觉与模式识别 2026-03-26 v1

摘要

近期生成式超分辨(SR)技术显著提升了视觉真实性,但现有评估与优化框架仍与人类感知不一致。全参考和无参考指标常常无法反映感知偏好,既可能因像素错位惩罚语义合理细节,又可能偏好视觉锐利但不一致的伪影。此外,大多数 SR 方法依赖基于 GT 的分布匹配,这不一定对应于人类判断。在本工作中,我们提出 RefReward-SR,一种低分辨率(LR)参考感知的奖励模型,用于偏好对齐的 SR。该方法不依赖 GT 监督或无参考评估,而是将 LR 图像作为语义锚点,对其条件下的高分辨率(HR)重构进行评估。我们利用多模态大语言模型(MLLM)的视觉-语言先验,对语义一致性与合理性进行推理式评估。为支撑此范式,我们构建了 RefSR-18K,首个大型 LR 条件偏好数据集,用于 SR,提供基于 LR-HR 一致性和 HR 自然性的两两排名。我们采用 LR 条件排名奖励对 MLLM 进行群体相对策略优化(GRPO)微调,并将 GRPO 整合到 SR 模型训练中,以 RefReward-SR 作为偏好生成的核心奖励信号。广泛实验表明,我们的框架在人类判断方面显著优于现有方法,生成的重构既保留了语义一致性,又提升了感知合理性与视觉自然性。代码、模型和数据集将在论文接受后发布。

关键词

引用

@article{arxiv.2603.24198,
  title  = {RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution},
  author = {Yushuai Song and Weize Quan and Weining Wang and Jiahui Sun and Jing Liu and Meng Li and Pengbin Yu and Zhentao Chen and Wei Shen and Lunxi Yuan and Dong-ming Yan},
  journal= {arXiv preprint arXiv:2603.24198},
  year   = {2026}
}