中文

GAOKAO-MM:面向多模态模型评估的中文人级别基准

计算与语言 2024-08-07 v2 人工智能 计算机视觉与模式识别

摘要

大型视觉语言模型(LVLMs)在图像感知和语言理解方面展现了强大能力。然而,现有的多模态基准侧重于初级感知能力和常识知识,不足以反映LVLMs的综合能力。我们提出了GAOKAO-MM,一个基于中国高考的多模态基准,包含8个科目和12种图像类型,如图表、函数图、地图和照片。GAOKAO-MM源自中文语境,对模型的能力设定了人类水平的要求,包括感知、理解、知识和推理。我们评估了10个LVLMs,发现所有模型的准确率均低于50%,其中GPT-4-Vision(48.1%)、Qwen-VL-Plus(41.2%)和Gemini-Pro-Vision(35.1%)位列前三。我们的多维分析结果表明,LVLMs与通用人工智能(AGI)之间仍有中等距离,并为多语言LVLMs的发展提供了见解。

关键词

引用

@article{arxiv.2402.15745,
  title  = {GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation},
  author = {Yi Zong and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2402.15745},
  year   = {2024}
}