Q-Bench+:面向多模态基础模型的单图至图对低层视觉基准
计算机视觉与模式识别
2024-08-13 v2
摘要
多模态大语言模型(MLLMs)的快速发展引领了计算机视觉领域的范式转变,正朝着通用基础模型迈进。然而,评估MLLMs在低层视觉感知与理解方面的能力仍是一个有待探索的领域。为此,我们设计了模拟与低层视觉相关的人类语言响应的基准设置:通过关于低层属性(如清晰度、光照)的视觉问答进行低层视觉感知(A1);以及评估MLLMs进行低层文本描述的低层视觉描述(A2)。此外,鉴于成对比较能更好地避免响应的歧义性,并已被许多人类实验所采用,我们进一步将MLLMs的低层感知相关问答和描述评估从单张图像扩展到图像对。具体而言,对于感知(A1),我们构建了LLVisionQA+数据集,包含2,990张单图像和1,999个图像对,每个都附带一个关于其低层特征的开放式问题;对于描述(A2),我们提出了LLDescribe+数据集,在499张单图像和450个图像对上评估MLLMs的低层描述能力。此外,我们通过采用基于softmax的方法使所有MLLMs都能生成可量化的质量评分,并在7个图像质量评估(IQA)数据集上与人类意见进行对比测试,从而评估MLLMs的评估(A3)能力。通过对24个MLLMs进行评估,我们证明了一些MLLMs在单图像上具有良好的低层视觉能力,但只有GPT-4V在成对比较上表现出比单图像评估更高的准确率(如同人类)。我们希望我们的基准能激励进一步的研究,以揭示和增强MLLMs的这些新兴能力。数据集将在https://github.com/Q-Future/Q-Bench上提供。
引用
@article{arxiv.2402.07116,
title = {Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs},
author = {Zicheng Zhang and Haoning Wu and Erli Zhang and Guangtao Zhai and Weisi Lin},
journal= {arXiv preprint arXiv:2402.07116},
year = {2024}
}
备注
Accepted by TPAMI. arXiv admin note: substantial text overlap with arXiv:2309.14181