VisualSimpleQA:大型视觉语言模型在事实寻求问答中解耦评估的基准
计算与语言
2025-03-11 v1 计算机视觉与模式识别
摘要
大型视觉语言模型(LVLMs)已展现出卓越成就,但在事实寻求问答(QA)中生成非事实性回答的现象依然普遍。当前的多模态事实寻求基准主要侧重于将模型输出与真实答案进行比较,对特定模态模块性能的洞察有限。为弥补这一空白,我们引入了 VisualSimpleQA,一个具有两个关键特征的多模态事实寻求基准。首先,它能够对 LVLMs 在视觉和语言模态上进行精简且解耦的评估。其次,它纳入了明确定义的难度标准以指导人工标注,并便于提取具有挑战性的子集 VisualSimpleQA-hard。在 15 个 LVLMs 上的实验表明,即使是 GPT-4o 等最先进的模型在 VisualSimpleQA 上的多模态事实寻求问答正确率也仅为 60%+,在 VisualSimpleQA-hard 上仅为 30%+。此外,这些模型的解耦评估突显了视觉和语言模块均有巨大的改进空间。该数据集可在 https://huggingface.co/datasets/WYLing/VisualSimpleQA 获取。
引用
@article{arxiv.2503.06492,
title = {VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering},
author = {Yanling Wang and Yihan Zhao and Xiaodong Chen and Shasha Guo and Lixin Liu and Haoyang Li and Yong Xiao and Jing Zhang and Qi Li and Ke Xu},
journal= {arXiv preprint arXiv:2503.06492},
year = {2025}
}