MME-Unify:面向统一多模态理解与生成模型的综合基准测试
计算机视觉与模式识别
2025-04-08 v2
摘要
现有的 MLLM 基准测试在评估统一 MLLM(U-MLLMs)时面临重大挑战,原因在于:1) 缺乏针对传统任务的标准化基准测试,导致比较不一致;2) 缺乏针对混合模态生成的基准测试,无法评估多模态推理能力。我们提出了一个旨在系统性评估 U-MLLMs 的综合评估框架。我们的基准测试包括:1. 标准化传统任务评估。我们从 12 个数据集中进行采样,涵盖 10 个任务和 30 个子任务,确保各项研究之间一致且公平的比较。2. 统一任务评估。我们引入了五项测试多模态推理的新任务,包括图像编辑、带图像生成的常识问答以及几何推理。3. 综合模型基准测试。我们评估了 12 个领先的 U-MLLMs,如 Janus-Pro、EMU3、VILA-U 和 Gemini2-flash,以及专门的理解模型(例如 Claude-3.5-Sonnet)和生成模型(例如 DALL-E-3)。我们的发现揭示了现有 U-MLLMs 中存在显著的性能差距,凸显了需要更强大、能有效处理混合模态任务的模型。代码和评估数据可在 https://mme-unify.github.io/ 获取。
引用
@article{arxiv.2504.03641,
title = {MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models},
author = {Wulin Xie and Yi-Fan Zhang and Chaoyou Fu and Yang Shi and Bingyan Nie and Hongkai Chen and Zhang Zhang and Liang Wang and Tieniu Tan},
journal= {arXiv preprint arXiv:2504.03641},
year = {2025}
}
备注
Project page: https://mme-unify.github.io/