Q-DeepSight:用于图像质量评估与细化的激励式图像思考框架
计算机视觉与模式识别
2026-04-21 v1
摘要
图像质量评估(IQA)模型日益被用作感知评论家,以指导生成模型和图像修复。这种角色不仅需要准确的评分,还需要可操作的、局部化的反馈。然而,当前基于大型多模态语言模型(LLM)的方法采用单次观察、仅语言的范式,偏离了人类的证据搜寻判断,导致理由缺乏强制性约束,限制了其在循环内细化中的可靠性。我们提出Q-DeepSight,一个模拟这种类人过程的思考-图像框架。它执行交错式多模态链式思考(iMCoT),并通过工具增强的证据获取(例如裁剪和缩放)显式确定质量退化的发生位置及原因。为通过强化学习训练这些长期iMCoT轨迹,我们引入了两种技术:感知课程奖励(PCR)以缓解奖励稀疏性,证据梯度过滤(EGF)以提高视觉约束推理的信用分配。Q-DeepSight在多样化基准测试(包括自然图像、修复图像和AI生成内容)上实现了最先进的性能。进一步,我们展示了其实际价值——感知生成内(PiG),一个无需训练的框架,其中Q-DeepSight的诊断指导迭代图像增强,有效地将评估与细化之间的循环闭合。
引用
@article{arxiv.2604.16858,
title = {Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement},
author = {Xudong Li and Jiaxi Tan and Ziyin Zhou and Yan Zhong and Zihao Huang and Jingyuan Zheng and Yan Zhang and Xiawu Zheng and Rongrong Ji},
journal= {arXiv preprint arXiv:2604.16858},
year = {2026}
}