WorldVQA: 衡量多模态大语言模型中原子级世界知识的基准
计算机视觉与模式识别
2026-02-04 v1 机器学习
摘要
我们提出 WorldVQA,这是一个用于评估多模态大语言模型(MLLMs)原子级视觉世界知识的基准测试。与当前常常混合视觉知识检索与推理的评估方法不同,WorldVQA 将这些能力解耦,以严格测量“模型记忆的内容”。该基准评估了从常见头部类别物体到长尾稀有物体的视觉实体跨越分层分类法中的锚定与命名原子能力。我们期望 WorldVQA 作为视觉事实性的严谨测试,为评估当前及下一代前沿模型的百科全书式广度和幻觉率提供标准。
引用
@article{arxiv.2602.02537,
title = {WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models},
author = {Runjie Zhou and Youbo Shao and Haoyu Lu and Bowei Xing and Tongtong Bai and Yujie Chen and Jie Zhao and Lin Sui and Haotian Yao and Zijia Zhao and Hao Yang and Haoning Wu and Zaida Zhou and Jinguo Zhu and Zhiqi Huang and Yiping Bao and Yangyang Liu and Y. Charles and Xinyu Zhou},
journal= {arXiv preprint arXiv:2602.02537},
year = {2026}
}