SpatialTree:空间能力如何在多模态大语言模型中分支发展
计算机视觉与模式识别
2026-01-08 v2
摘要
认知科学表明,空间能力是逐步发展的——从感知到推理再到交互。然而,在多模态大语言模型(MLLM)中,这种层次结构仍然知之甚少,因为大多数研究只关注于狭窄的任务集。我们引入了SpatialTree,一个受认知科学启发的层次结构,将空间能力组织为四个层次:低级感知(L1)、心理映射(L2)、模拟(L3)和智能体能力(L4)。基于这一分类法,我们构建了首个以能力为中心的层次化基准,全面评估了主流MLLM在27项子能力上的表现。评估结果揭示了一个清晰的结构:L1技能在很大程度上是正交的,而更高级别的技能则高度相关,表明相互依赖性增加。通过有针对性的监督微调,我们揭示了一种令人惊讶的迁移动态——L1内部存在负迁移,但从低级到高级能力存在强跨层迁移,并伴有显著的协同效应。最后,我们探讨了如何改进整个层次结构。我们发现,鼓励大量“思考”的朴素强化学习(RL)是不可靠的:它有助于复杂推理,但会损害直觉感知。我们提出了一种简单的自动思考策略,该策略抑制不必要的深思熟虑,使RL能够持续提升所有层次的性能。通过构建SpatialTree,我们为理解和系统性地扩展MLLM中的空间能力提供了一个概念验证框架。
引用
@article{arxiv.2512.20617,
title = {SpatialTree: How Spatial Abilities Branch Out in MLLMs},
author = {Yuxi Xiao and Longfei Li and Shen Yan and Xinhang Liu and Sida Peng and Yunchao Wei and Xiaowei Zhou and Bingyi Kang},
journal= {arXiv preprint arXiv:2512.20617},
year = {2026}
}
备注
webpage: https://spatialtree.github.io/