MMMU-Pro:更稳健的多学科多模态理解基准
计算与语言
2025-05-23 v3 计算机视觉与模式识别
摘要
本文介绍了 MMMU-Pro,这是一个来自大规模多学科多模态理解与推理(MMMU)基准的更稳健版本。MMMU-Pro 通过基于 MMMU 的三步过程严格评估多模态模型的真实理解和推理能力:(1)过滤掉仅可由文本模型回答的问题;(2)增强候选选项;(3)引入仅视觉输入设置,其中问题嵌入图像中。这一设置挑战着 AI 必须同时“看”和“读”,测试一种基本的人类认知技能,即无缝整合视觉和文本信息。结果表明,MMMU-Pro 上模型性能显著低于 MMMU,模型间表现从 16.8% 到 26.9%。我们探讨了 OCR 提示和链路思考(CoT)的影响,发现 OCR 提示影响最小,而 CoT 通常会提高性能。MMMU-Pro 提供了一个更严格的评估工具,更贴近现实场景,并为未来在多模态 AI 领域的研究提供了宝贵的方向。
引用
@article{arxiv.2409.02813,
title = {MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark},
author = {Xiang Yue and Tianyu Zheng and Yuansheng Ni and Yubo Wang and Kai Zhang and Shengbang Tong and Yuxuan Sun and Botao Yu and Ge Zhang and Huan Sun and Yu Su and Wenhu Chen and Graham Neubig},
journal= {arXiv preprint arXiv:2409.02813},
year = {2025}
}
备注
ACL 2025 Main