中文

“看世界,发现知识”:面向大型视觉语言模型的中文事实性评估

计算与语言 2025-06-02 v4 计算机视觉与模式识别

摘要

大型视觉语言模型(LVLMs)的事实准确性评估滞后于其快速发展,难以充分反映这些模型的知识能力和可靠性。本文引入了第一个基于事实性的中文视觉问答基准测试,命名为ChineseSimpleVQA,旨在评估LVLMs在8个主要主题和56个子主题上的视觉事实性。该基准的关键特征包括:关注中文语言,涵盖多样知识类型,采用多跳问题构建,数据高质量,静态一致性,易于通过简短答案进行评估。此外,我们贡献了一个严格的数据构建管道,并将视觉事实性解耦为两个部分:看世界(即对象识别)和发现知识。这种解耦允许我们分析LVLMs的能力边界和执行机制。随后,我们评估了34个先进的开源和闭源模型,揭示了该领域的关键性能差距。我们的评估友好代码和数据已开源。

关键词

引用

@article{arxiv.2502.11718,
  title  = {"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models},
  author = {Jihao Gu and Yingyao Wang and Pi Bu and Chen Wang and Ziming Wang and Tengtao Song and Donglai Wei and Jiale Yuan and Yingxiu Zhao and Yancheng He and Shilong Li and Jiaheng Liu and Meng Cao and Jun Song and Yingshui Tan and Xiang Li and Wenbo Su and Zhicheng Zheng and Xiaoyong Zhu and Bo Zheng},
  journal= {arXiv preprint arXiv:2502.11718},
  year   = {2025}
}

备注

26 pages, 21 figures