WikiVQABench:来自 Wikipedia 和 Wikidata 的知识驱动视觉问答基准
计算机视觉与模式识别
2026-05-21 v1 人工智能
摘要
视觉问答基准主要强调可从视觉内容alone解决的感知任务。相比之下,许多现实场景需要外部知识才能正确回答,因为该知识不可直接观察于图像中。我们引入 WikiVQABench,这是一个由人工审核的知识驱动 VQA 基准,通过系统性地组合 Wikipedia 图像、其关联文章标题和结构化的 Wikidata 知识。我们的管道使用大语言模型生成候选的多选图像-问题-答案集合。所有生成的实例随后由人工标注者审核和策划,以确保事实正确性、视觉文本一致性,以及每个问题都需要除视觉证据外的外部知识才能正确解答。WikiVQABench 包含大量 Wikipedia 图像,配有精心策划的多选问题,旨在基准测试对知识感知的视觉语言模型。对十五种 VLM(2.56 亿至90亿参数)进行评估,显示出广泛的性能范围(24.7%至75.6%准确率),表明该基准有效区分知识密集型推理模型的能力。该数据集和基准测试代码已公开。
引用
@article{arxiv.2605.21479,
title = {WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata},
author = {Basel Shbita and Pengyuan Li and Anna Lisa Gentile},
journal= {arXiv preprint arXiv:2605.21479},
year = {2026}
}