Q-Insight:基于视觉强化学习的图像质量理解
计算机视觉与模式识别
2025-05-26 v2
摘要
图像质量评估(IQA)聚焦于图像的感知视觉质量,在图像重建、压缩和生成等下游任务中发挥着关键作用。多模态大语言模型(MLLM)的快速发展显著拓宽了IQA的应用范围,使其正朝着涵盖内容分析、损坏感知和比较推理(超越纯粹数值评分)的全面图像质量理解方向发展。以往基于MLLM的方法通常要么生成缺乏可解释性的数值评分,要么严重依赖基于大规模标注数据集的监督微调(SFT),以提供描述性评估,这限制了其灵活性和适用性。在本文中,我们提出了Q-Insight,一种基于群体相对策略优化(GRPO)的强化学习模型,能够在仅需有限评分数据和损坏标签的情况下,展现出强大的视觉推理能力,用于图像质量理解。通过设计精心的奖励函数联合优化评分回归和损坏感知任务,本方法有效利用两者的相互优势以提升性能。大量实验表明,Q-Insight在评分回归和损坏感知任务中均显著优于现有最先进方法,同时在比较推理任务中展现出惊人的零样本泛化能力。代码将在 https://github.com/lwq20020127/Q-Insight 公开。
引用
@article{arxiv.2503.22679,
title = {Q-Insight: Understanding Image Quality via Visual Reinforcement Learning},
author = {Weiqi Li and Xuanyu Zhang and Shijie Zhao and Yabin Zhang and Junlin Li and Li Zhang and Jian Zhang},
journal= {arXiv preprint arXiv:2503.22679},
year = {2025}
}