中文

多模态大语言模型空间智能的整体评估

计算机视觉与模式识别 2026-01-01 v5 计算与语言 机器学习 多媒体 机器人学

摘要

多模态模型近年来取得了显著进展。然而,它们在空间理解与推理方面仍表现出明显的局限性,而这一能力正是将通用人工智能锚定在物理世界的关键。随着据称是迄今为止最强大的 AI 模型 GPT-5 的发布,现在是时候审视领先模型(GPT、Gemini、Grok、Seed、Qwen 和 Intern)在通往空间智能(SI)的道路上处于什么位置。因此,我们提出 EASI,用于多模态大语言模型空间智能的整体评估。EASI 概念化了一个全面的空间任务分类法,统一了现有基准和不断增长的新策划基准集合,从而能够对最先进的模型进行系统评估。在本报告中,我们跨八个关键基准进行了研究,总消耗超过百亿 token。我们的实证研究揭示:(1) GPT-5 在空间智能方面展现出前所未有的优势,然而 (2) 在广泛的 SI 任务谱系中仍显著低于人类表现。此外,我们 (3) 表明 SI 任务比非 SI 任务暴露了更大的模型能力缺陷,以至于 (4) 在面对最困难的任务时,闭源模型并未展现出决定性优势。此外,我们对一系列对人类而言直观但最先进的多模态模型却失败的多样化场景进行了定性评估。EASI 是一项持续的社区努力:我们已开源 EASI 代码库,提供一站式、可复现的解决方案,具有标准化接口、集成协议和提示词,显著减少了配置和运行多个基准的摩擦;我们还推出了配套的 EASI 排行榜,提供模型在整个 SI 谱系上性能的持续更新快照,加速向鲁棒空间智能的集体进步。

关键词

引用

@article{arxiv.2508.13142,
  title  = {Holistic Evaluation of Multimodal LLMs on Spatial Intelligence},
  author = {Zhongang Cai and Yubo Wang and Qingping Sun and Ruisi Wang and Chenyang Gu and Wanqi Yin and Zhiqian Lin and Zhitao Yang and Chen Wei and Oscar Qian and Hui En Pang and Xuanke Shi and Kewang Deng and Xiaoyang Han and Zukai Chen and Jiaqi Li and Xiangyu Fan and Hanming Deng and Lewei Lu and Bo Li and Ziwei Liu and Quan Wang and Dahua Lin and Lei Yang},
  journal= {arXiv preprint arXiv:2508.13142},
  year   = {2026}
}

备注

Codebase: https://github.com/EvolvingLMMs-Lab/EASI/ ; Leaderboard: https://huggingface.co/spaces/lmms-lab-si/EASI-Leaderboard