中文

MME-Unify:面向统一多模态理解与生成模型的综合基准测试

计算机视觉与模式识别 2025-04-08 v2

摘要

现有的 MLLM 基准测试在评估统一 MLLM(U-MLLMs)时面临重大挑战,原因在于:1) 缺乏针对传统任务的标准化基准测试,导致比较不一致;2) 缺乏针对混合模态生成的基准测试,无法评估多模态推理能力。我们提出了一个旨在系统性评估 U-MLLMs 的综合评估框架。我们的基准测试包括:1. 标准化传统任务评估。我们从 12 个数据集中进行采样,涵盖 10 个任务和 30 个子任务,确保各项研究之间一致且公平的比较。2. 统一任务评估。我们引入了五项测试多模态推理的新任务,包括图像编辑、带图像生成的常识问答以及几何推理。3. 综合模型基准测试。我们评估了 12 个领先的 U-MLLMs,如 Janus-Pro、EMU3、VILA-U 和 Gemini2-flash,以及专门的理解模型(例如 Claude-3.5-Sonnet)和生成模型(例如 DALL-E-3)。我们的发现揭示了现有 U-MLLMs 中存在显著的性能差距,凸显了需要更强大、能有效处理混合模态任务的模型。代码和评估数据可在 https://mme-unify.github.io/ 获取。

关键词

引用

@article{arxiv.2504.03641,
  title  = {MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models},
  author = {Wulin Xie and Yi-Fan Zhang and Chaoyou Fu and Yang Shi and Bingyan Nie and Hongkai Chen and Zhang Zhang and Liang Wang and Tieniu Tan},
  journal= {arXiv preprint arXiv:2504.03641},
  year   = {2025}
}

备注

Project page: https://mme-unify.github.io/