中文

IRPO:通过后训练GRPO提升图像修复

计算机视觉与模式识别 2026-05-28 v3

摘要

后训练在高层生成中发挥作用日益显著,但在低层视觉任务中仍鲜有探索。现有图像修复方法常依赖对真实图像的固定像素级拟合,易导致过平滑与泛化能力弱。我们提出IRPO—a基于GRPO的后训练框架,用于确定性修复模型。IRPO包含两个维度:数据表述与奖励建模。关于数据表述,我们从预训练阶段选取30%的表现不佳样本,可提升准确率与训练效率。关于奖励建模,我们融合保真度导向与质量感知反馈,包含三个组成部分:通用奖励用于结构保真度、专家奖励以视觉语言模型为粗糙视觉质量评判器,以及针对任务特定低层线索的修复奖励。六个领域内及五个跨域(OOD)基准实验表明,IRPO在领域内任务上较AdaIR基线提升0.93 dB,在OOD设置上提升3.43 dB。我们的代码已公开于https://github.com/HaoxuanXU1024/IRPO。

关键词

引用

@article{arxiv.2512.00814,
  title  = {IRPO: Boosting Image Restoration via Post-training GRPO},
  author = {Haoxuan Xu and Yi Liu and Tianfu Li and Ruolin Shen and Boyuan Jiang and Jinlong Peng and Donghao Luo and Xiaobin Hu and Shuicheng Yan and Haoang Li},
  journal= {arXiv preprint arXiv:2512.00814},
  year   = {2026}
}