MMIU:用于评估大型视觉语言模型的多模态多图像理解
计算机视觉与模式识别
2024-08-07 v1
摘要
处理多个图像的能力是大型视觉语言模型 (LVLMs) 开发更全面和细致理解场景的关键。最近的多图像 LVLMs 开始致力于此需求。然而,其评估进展不足。为填补这一差距,我们引入了多模态多图像理解 (Multimodal Multi-image Understanding, MMIU) 基准,这是一个综合性评估套件,旨在评估 LVLMs 在广泛范围的多图像任务中的表现。MMIU涵盖7种多图像关系类型、52项任务、7.7万张图像和1.1万项精心策划的多选问题,堪称其类别最全面的基准。我们对24个流行 LVLMs(包括开源和专有模型)的评估揭示了多图像理解方面的重大挑战,尤其是空间理解任务。即便是最先进的模型,如 GPT-4o,也仅在 MMIU 上获得55.7%的准确率。通过多方面的分析实验,我们识别出关键性能差距和局限性,为未来模型和数据改进提供了宝贵见解。我们期望 MMIU 推动 LVLMs 研究与开发的前沿进展,使我们朝向实现复杂的多模态多图像用户交互迈进。
引用
@article{arxiv.2408.02718,
title = {MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models},
author = {Fanqing Meng and Jin Wang and Chuanhao Li and Quanfeng Lu and Hao Tian and Jiaqi Liao and Xizhou Zhu and Jifeng Dai and Yu Qiao and Ping Luo and Kaipeng Zhang and Wenqi Shao},
journal= {arXiv preprint arXiv:2408.02718},
year = {2024}
}
备注
Project Page: https://mmiu-bench.github.io/