中文

MULTI:基于文本和图像的多模态理解评估榜

计算与语言 2025-10-16 v4 人工智能 计算机视觉与模式识别

摘要

多模态大型语言模型(MLLM)的快速发展引发了其与人类性能比较的疑问。虽然现有数据集常包含人工合成或过于简单粗糙的任务,但已有模型已超越人类专家基准。本文提出MULTI,一个源自真实考试问题的中文多模态数据集。该数据集包含超过18,000个精心挑选和优化的问题,按真实考试标准进行评估,涵盖图像-文本理解、复杂推理和知识回忆。此外,我们还引入MULTI-Elite,一个精选的500题难题子集,以及MULTI-Extend,包含超过4,500个外部知识背景片段,用于测试情境学习能力。我们的评估显示,MLLM仍有大量提升空间,Qwen2-VL-72B在MULTI上取得76.9%准确率,在MULTI-Elite上为53.1%,领先于25个评估模型,相较于人类专家基准分别为86.1%和73.1%。MULTI不仅作为强大的评估平台,更为开发达到专家水平的人工智能指明了方向。

关键词

引用

@article{arxiv.2402.03173,
  title  = {MULTI: Multimodal Understanding Leaderboard with Text and Images},
  author = {Zichen Zhu and Yang Xu and Lu Chen and Jingkai Yang and Yichuan Ma and Yiming Sun and Hailin Wen and Jiaqi Liu and Jinyu Cai and Yingzi Ma and Situo Zhang and Zihan Zhao and Liangtai Sun and Kai Yu},
  journal= {arXiv preprint arXiv:2402.03173},
  year   = {2025}
}

备注

24 pages, 19 figures, 10 tables. Details and access are available at: https://OpenDFM.github.io/MULTI-Benchmark/