中文

Grounding-IQA:面向图像质量评估的多模态语言模型 grounding

计算机视觉与模式识别 2026-03-03 v5

摘要

多模态大语言模型(MLLM)的发展使得通过自然语言描述来评估图像质量成为可能。这一进展允许进行更详细的评估。然而,这些MLLM-based IQA方法主要依赖通用情境描述,有时限制了细粒度的质量评估。为此,我们提出一种新的图像质量评估(IQA)任务范式,**grounding-IQA**。该范式将多模态指涉与grounding与IQA相结合,以实现更细粒度的质量感知,从而扩展了现有的IQA方法。具体而言,grounding-IQA包含两个子任务:grounding-IQA-description(GIQA-DES)和视觉问答(GIQA-VQA)。GIQA-DES涉及带有精确位置(如边界框)的详细描述,而GIQA-VQA聚焦于局部区域的质量问答。为实现grounding-IQA,我们通过提出的自动标注管道构建了相应数据集GIQA-160K。此外,我们设计了一个综合基准,GIQA-Bench。该基准从三个角度评估grounding-IQA性能:描述质量、VQA准确率和grounding精确度。实验表明,我们的方法促进了更细粒度的IQA应用。代码:https://github.com/zhengchen1999/Grounding-IQA。

关键词

引用

@article{arxiv.2411.17237,
  title  = {Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment},
  author = {Zheng Chen and Xun Zhang and Wenbo Li and Renjing Pei and Fenglong Song and Xiongkuo Min and Xiaohong Liu and Xin Yuan and Yong Guo and Yulun Zhang},
  journal= {arXiv preprint arXiv:2411.17237},
  year   = {2026}
}

备注

Accepted to ICLR 2026. Code is available at: https://github.com/zhengchen1999/Grounding-IQA