中文

MME-RealWorld: 你的多模态大语言模型能挑战人类难以应对的高分辨率真实世界场景吗?

计算机视觉与模式识别 2025-02-06 v3

摘要

多模态大语言模型(MLLM)的全面评估近来引起了研究界的广泛关注。然而,我们观察到现有基准存在几个常见障碍,使其难以衡量模型在真实世界中面临的重大挑战,包括:1) 数据规模小导致性能方差大;2) 依赖基于模型的标注导致数据质量受限;3) 任务难度不足,尤其受限于图像分辨率。为解决这些问题,我们引入了MME-RealWorld。具体来说,我们从公共数据集和互联网收集了超过30万张图像,筛选出13,366张高质量图像进行标注。这涉及25名专业标注员和7名MLLM专家的努力,贡献了29,429个问答对,涵盖5个真实世界场景中的43个子任务,这些任务即使对人类也极具挑战性。据我们所知,MME-RealWorld是迄今为止最大的手动标注基准,具有最高分辨率,并专注于真实世界应用。我们进一步对28个著名的MLLM(如GPT-4o、Gemini 1.5 Pro和Claude 3.5 Sonnet)进行了彻底评估。我们的结果表明,即使是最先进的模型也难以应对我们的基准,其中没有一个模型达到60%的准确率。感知高分辨率图像和理解复杂真实世界场景的挑战仍然是亟待解决的问题。数据和评估代码已在https://mme-realworld.github.io/发布。

关键词

引用

@article{arxiv.2408.13257,
  title  = {MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?},
  author = {Yi-Fan Zhang and Huanyu Zhang and Haochen Tian and Chaoyou Fu and Shuangqing Zhang and Junfei Wu and Feng Li and Kun Wang and Qingsong Wen and Zhang Zhang and Liang Wang and Rong Jin and Tieniu Tan},
  journal= {arXiv preprint arXiv:2408.13257},
  year   = {2025}
}

备注

Project Page: https://mme-realworld.github.io/; accepted by ICLR 2025