CMMMU:一个中文大规模多学科多模态理解基准
计算与语言
2024-11-05 v4 人工智能
计算机视觉与模式识别
摘要
随着大型多模态模型(LMM)能力的持续提升,评估LMM性能的需求日益增长。此外,在非英语环境(如中文)中评估LMM的高级知识和推理能力存在更大的差距。我们引入了CMMMU,这是一个新的中文大规模多学科多模态理解基准,旨在评估LMM在中文环境下需要大学级学科知识和深思熟虑推理的任务。CMMMU受MMMU启发,并严格遵循其标注和分析模式。CMMMU包含从大学考试、测验和教科书中手动收集的12k个多模态问题,涵盖六个核心学科:艺术与设计、商业、科学、健康与医学、人文与社会科学以及技术与工程,与其姊妹基准MMMU类似。这些问题跨越30个科目,包含39种高度异质的图像类型,如图表、示意图、地图、表格、乐谱和化学结构。CMMMU专注于中文环境下具有领域特定知识的复杂感知和推理。我们评估了11个开源LLM和一个专有GPT-4V(ision)。即使是GPT-4V也仅达到42%的准确率,表明仍有很大的改进空间。CMMMU将通过提供多样化的语言环境,推动社区构建下一代面向专家人工智能的LMM,并促进LMM的民主化。
引用
@article{arxiv.2401.11944,
title = {CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark},
author = {Ge Zhang and Xinrun Du and Bei Chen and Yiming Liang and Tongxu Luo and Tianyu Zheng and Kang Zhu and Yuyang Cheng and Chunpu Xu and Shuyue Guo and Haoran Zhang and Xingwei Qu and Junjie Wang and Ruibin Yuan and Yizhi Li and Zekun Wang and Yudong Liu and Yu-Hsuan Tsai and Fengji Zhang and Chenghua Lin and Wenhao Huang and Jie Fu},
journal= {arXiv preprint arXiv:2401.11944},
year = {2024}
}