中文

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的思维链图像恢复智能体

图像与视频处理 2026-04-14 v2

摘要

图像恢复(IR)在现实场景中经常面临各种复杂且未知的退化,例如噪声、模糊、压缩伪影和低分辨率等。针对特定退化训练特定模型可能导致泛化能力差。为了同时处理多种退化,All-in-One模型可能会牺牲某些退化类型的性能,并且仍然难以处理训练中未见过的退化。现有的IR智能体依赖多模态大语言模型(MLLM)和耗时的回滚选择策略,忽略了图像质量。因此,它们可能误解退化,并以冗余的顺序执行不必要的IR任务,导致高昂的时间和计算成本。为了解决这些问题,我们提出了一种通过思维链(CoT)恢复的质量驱动智能体(Q-Agent)。具体来说,我们的Q-Agent由鲁棒退化感知和质量驱动的贪婪恢复组成。前者模块首先微调MLLM,并使用CoT将多退化感知分解为单退化感知任务,以增强MLLM的感知能力。后者采用客观图像质量评估(IQA)指标来确定最佳恢复顺序,并执行相应的恢复算法。实验结果表明,与现有的All-in-One模型相比,我们的Q-Agent实现了更优越的IR性能。

关键词

引用

@article{arxiv.2504.07148,
  title  = {Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model},
  author = {Yingjie Zhou and Jiezhang Cao and Farong Wen and Zicheng Zhang and Yu Zhou and Yue Shi and Xiaohong Liu and Radu Timofte and Luc Van Gool and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2504.07148},
  year   = {2026}
}