中文

MOAT:评估大多模态模型的能力整合与指令定位

计算与语言 2025-12-15 v2 人工智能 计算机视觉与模式识别

摘要

大多模态模型(LMMs)在视觉-语言(VL)任务中展现出了作为通用模型的显著潜力。然而,LMMs在现实世界任务中的应用受到其在需要组合VL能力的任务中表现不佳的阻碍,以及在涉及复杂文本或视觉指令定位的任务中表现不佳的阻碍。为了全面调查这一差距及其潜在原因,我们提出了MOAT,一个包含1005个复杂现实世界视觉问题的多样化基准,这些问题对人类来说简单但对LMMs来说具有挑战性。具体而言,MOAT中的任务要求LMMs通过整合VL能力(如阅读文本、计数、理解空间关系、定位文本和视觉指令等)进行通用问题求解。所有这些能力都符合我们提出的包含9种VL能力的分类法,使MOAT能够提供LMMs优势和劣势的细粒度视图。此外,MOAT是第一个明确评估LMMs对复杂文本和视觉指令定位能力的基准,这对许多现实世界应用至关重要。我们评估了17种专有和开源LMMs,发现表现最好的LMM(Gemini 2.5 Pro)仅达到44%的准确率,远低于现实世界应用可接受的水平。为指导未来模型开发,我们分析了结果中的常见趋势并讨论了表现不佳的潜在原因,重点关注以文本为中心的推理的影响、哪些VL能力在复杂任务中形成瓶颈,以及拼接可能产生的有害影响。代码和数据可在 https://cambrian-yzt.github.io/MOAT/ 获取。

关键词

引用

@article{arxiv.2503.09348,
  title  = {MOAT: Evaluating LMMs for Capability Integration and Instruction Grounding},
  author = {Zhoutong Ye and Mingze Sun and Huan-ang Gao and Xutong Wang and Xiangyang Wang and Yu Mei and Chang Liu and Qinwei Li and Chengwen Zhang and Qinghuan Lan and Chun Yu and Yuanchun Shi},
  journal= {arXiv preprint arXiv:2503.09348},
  year   = {2025}
}

备注

Project page: https://cambrian-yzt.github.io/MOAT