Restore-R1:基于多模态LLM感知反馈的强化学习图像修复代理
计算机视觉与模式识别
2026-04-07 v2
摘要
复杂图像修复旨在从受多种退化(如模糊、噪声、雨、压缩伪影)影响的输入中恢复高质量图像。近期由视觉语言模型和大语言模型驱动的修复代理展现出具有前景的修复能力,但因反思、回滚和迭代工具搜索等问题导致效率严重受限。此外,其性能高度依赖需要大量标注训练的退化识别模型,限制了其在无标签环境中的适用性。为此,我们提出一种基于策略优化的修复框架,通过学习轻量级代理来确定工具调用序列。该代理在序列决策过程中选择每个步骤中最合适的修复操作,以最大化最终图像质量。为实现无标签环境下的训练,我们引入一种由多模态大语言模型驱动的新颖奖励机制,作为人类对齐的评估器,为策略改进提供感知反馈。训练完成后,我们的代理可在无冗余工具调用的情况下执行确定性修复计划,显著加速推理过程,同时保持高质量的修复效果。大量实验表明,尽管无需监督,我们的方法在全参考指标上达到SOTA性能,并在多样化退化情景下在无参考指标上超越现有方法。
引用
@article{arxiv.2512.18599,
title = {Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback},
author = {Jianglin Lu and Yuanwei Wu and Ziyi Zhao and Hongcheng Wang and Felix Jimenez and Abrar Majeedi and Yun Fu},
journal= {arXiv preprint arXiv:2512.18599},
year = {2026}
}