中文

MMMU:面向专家级通用人工智能的大规模多学科多模态理解与推理基准

计算与语言 2024-06-14 v4 人工智能 计算机视觉与模式识别

摘要

我们提出 MMMU:一个旨在评估多模态模型在需要大学水平学科知识与审慎推理的大规模多学科任务上表现的新基准。MMMU 包含从大学考试、测验与教材中精心收集的 11.5K 多模态问题,涵盖六大核心学科:艺术与设计、商业、科学、健康与医学、人文与社会科学、以及技术与工程。这些问题跨越 30 个学科与 183 个子领域,包含 30 种高度异质的图像类型,如图表、示意图、地图、表格、乐谱与化学结构。不同于现有基准,MMMU 聚焦于具备领域特定知识的高级感知与推理,挑战模型执行类似专家所面临任务。对 14 个开源 LMM 以及专有 GPT-4V(ision) 与 Gemini 的评估凸显了 MMMU 带来的重大挑战。即便先进的 GPT-4V 与 Gemini Ultra 也仅分别取得 56% 与 59% 的准确率,表明存在显著改进空间。我们相信 MMMU 将激励社区构建面向专家级通用人工智能的下一代多模态基础模型。

关键词

引用

@article{arxiv.2311.16502,
  title  = {MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI},
  author = {Xiang Yue and Yuansheng Ni and Kai Zhang and Tianyu Zheng and Ruoqi Liu and Ge Zhang and Samuel Stevens and Dongfu Jiang and Weiming Ren and Yuxuan Sun and Cong Wei and Botao Yu and Ruibin Yuan and Renliang Sun and Ming Yin and Boyuan Zheng and Zhenzhu Yang and Yibo Liu and Wenhao Huang and Huan Sun and Yu Su and Wenhu Chen},
  journal= {arXiv preprint arXiv:2311.16502},
  year   = {2024}
}

备注

CVPR 2024 Oral