GAOKAO-MM:面向多模态模型评估的中文人级别基准
计算与语言
2024-08-07 v2 人工智能
计算机视觉与模式识别
摘要
大型视觉语言模型(LVLMs)在图像感知和语言理解方面展现了强大能力。然而,现有的多模态基准侧重于初级感知能力和常识知识,不足以反映LVLMs的综合能力。我们提出了GAOKAO-MM,一个基于中国高考的多模态基准,包含8个科目和12种图像类型,如图表、函数图、地图和照片。GAOKAO-MM源自中文语境,对模型的能力设定了人类水平的要求,包括感知、理解、知识和推理。我们评估了10个LVLMs,发现所有模型的准确率均低于50%,其中GPT-4-Vision(48.1%)、Qwen-VL-Plus(41.2%)和Gemini-Pro-Vision(35.1%)位列前三。我们的多维分析结果表明,LVLMs与通用人工智能(AGI)之间仍有中等距离,并为多语言LVLMs的发展提供了见解。
引用
@article{arxiv.2402.15745,
title = {GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation},
author = {Yi Zong and Xipeng Qiu},
journal= {arXiv preprint arXiv:2402.15745},
year = {2024}
}