中文

SpatialTree:空间能力如何在多模态大语言模型中分支发展

计算机视觉与模式识别 2026-01-08 v2

摘要

认知科学表明,空间能力是逐步发展的——从感知到推理再到交互。然而,在多模态大语言模型(MLLM)中,这种层次结构仍然知之甚少,因为大多数研究只关注于狭窄的任务集。我们引入了SpatialTree,一个受认知科学启发的层次结构,将空间能力组织为四个层次:低级感知(L1)、心理映射(L2)、模拟(L3)和智能体能力(L4)。基于这一分类法,我们构建了首个以能力为中心的层次化基准,全面评估了主流MLLM在27项子能力上的表现。评估结果揭示了一个清晰的结构:L1技能在很大程度上是正交的,而更高级别的技能则高度相关,表明相互依赖性增加。通过有针对性的监督微调,我们揭示了一种令人惊讶的迁移动态——L1内部存在负迁移,但从低级到高级能力存在强跨层迁移,并伴有显著的协同效应。最后,我们探讨了如何改进整个层次结构。我们发现,鼓励大量“思考”的朴素强化学习(RL)是不可靠的:它有助于复杂推理,但会损害直觉感知。我们提出了一种简单的自动思考策略,该策略抑制不必要的深思熟虑,使RL能够持续提升所有层次的性能。通过构建SpatialTree,我们为理解和系统性地扩展MLLM中的空间能力提供了一个概念验证框架。

关键词

引用

@article{arxiv.2512.20617,
  title  = {SpatialTree: How Spatial Abilities Branch Out in MLLMs},
  author = {Yuxi Xiao and Longfei Li and Shen Yan and Xinhang Liu and Sida Peng and Yunchao Wei and Xiaowei Zhou and Bingyi Kang},
  journal= {arXiv preprint arXiv:2512.20617},
  year   = {2026}
}

备注

webpage: https://spatialtree.github.io/