中文

基于难度自适应强化学习的扩散恢复模型提升(以 IQA 奖励为例)

计算机视觉与模式识别 2025-11-04 v1

摘要

强化学习 (RL) 最近被用于扩散模型中,例如用于文本到图像等任务。然而,直接将现有的 RL 方法应用于基于扩散的图像恢复模型并不理想,因为恢复的目标不同于纯粹的生成:它更强调保真度。在本文中,我们研究如何有效地将 RL 集成到基于扩散的恢复模型中。首先,通过对各种奖励函数进行大量实验,我们发现基于图像质量评估 (IQA) 模型的奖励更为有效,而不是直观的基于ground-truth的监督——后者在监督微调 (SFT) 阶段已经优化。此外,我们的策略聚焦于使用 RL 处理那些与ground-truth 距离显著大的困难样本,我们的 RL 方法创新性地使用基于 MLLM 的 IQA 模型来实现与高质量图像的分布对齐。随着样本逐渐接近ground-truth 的分布,RL 被自适应地与 SFT 结合,以实现更细致的对齐。这一动态过程通过一种自动加权策略实现,该策略根据训练样本的相对难度进行调整。我们的策略是即插即用的,可以无缝应用于基于扩散的恢复模型,提升其在各种恢复任务中的性能。广泛的实验在多个基准数据集上表明,我们提出的 RL 框架有效。

关键词

引用

@article{arxiv.2511.01645,
  title  = {Enhancing Diffusion-based Restoration Models via Difficulty-Adaptive Reinforcement Learning with IQA Reward},
  author = {Xiaogang Xu and Ruihang Chu and Jian Wang and Kun Zhou and Wenjie Shu and Harry Yang and Ser-Nam Lim and Hao Chen and Liang Lin},
  journal= {arXiv preprint arXiv:2511.01645},
  year   = {2025}
}