为何 MLLMs 在空间理解方面受限?从数据到架构的系统性分析
计算机视觉与模式识别
2025-09-03 v1
摘要
空间理解是支持多模态大语言模型(MLLMs)在具身环境中实现感知、推理与规划能力的关键。尽管近期研究取得了进展,但现有研究表明 MLLMs 在空间理解方面仍面临挑战。然而,现有研究缺乏对这些局限性的全面且系统的评估,往往仅限于单视图或视频等孤立场景。本文从数据和架构两个维度,跨越单视图、多视图和视频三个典型场景,系统性地分析空间理解问题。我们提出了一个名为 MulSeT(多视图空间理解任务)的基准测试,并设计一系列实验来评估 MLLMs 的空间推理能力。从数据角度来看,随着训练数据的增加,空间理解性能迅速收敛,且上限相对较低,尤其是那些需要空间想象的任务。这表明,仅扩大训练数据并不足以获得令人满意的性能。从架构角度来看,我们发现空间理解更依赖于视觉编码器中的位置编码,而非语言模型中的位置编码,无论是级联型还是原生型 MLLMs 均如此。此外,我们探索了推理注入技术,并通过架构设计展望未来的改进方向,以优化空间理解能力。这些见解为揭示当前 MLLMs 的局限性指明了方向,同时为通过数据扩展和架构调优来提升空间推理能力提供了新思路。
关键词
引用
@article{arxiv.2509.02359,
title = {Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture},
author = {Wanyue Zhang and Yibin Huang and Yangbin Xu and JingJing Huang and Helu Zhi and Shuo Ren and Wang Xu and Jiajun Zhang},
journal= {arXiv preprint arXiv:2509.02359},
year = {2025}
}
备注
The benchmark MulSeT is available at https://huggingface.co/datasets/WanyueZhang/MulSeT