规模及超越:需要新配方才能在 MLLMs 中提升空间推理能力
机器学习
2025-06-04 v2
摘要
多模态大语言模型(MLLMs)在通用视觉语言任务中展现了惊人的性能。然而,近期研究暴露了其空间推理能力的关键局限。这种空间推理的缺失显著限制了 MLLMs 与物理世界有效交互的能力,从而限制了其更广泛的应用。我们认为,空间推理能力不会仅通过扩大现有架构和训练方法自然涌现。相反,这一挑战需要对当前 MLLM 开发方法进行根本性的修改。本文是一篇立场论文,我们首先在 MLLM 上下文中建立了完整的空间推理框架。随后,我们阐述了其在现实应用中的关键作用。通过系统分析,我们检视了从训练数据到推理机制的当前方法各个组成部分如何影响空间推理能力。这一检视揭示了关键局限性,同时也确定了具有前景的进步方向。我们的工作旨在引导 AI 研究社区关注这些至关重要但尚未充分探索的方面。通过突出这些挑战和机遇,我们希望催化 MLLMs 实现类人空间推理能力的进展。
引用
@article{arxiv.2504.15037,
title = {Scaling and Beyond: Advancing Spatial Reasoning in MLLMs Requires New Recipes},
author = {Huanyu Zhang and Chengzu Li and Wenshan Wu and Shaoguang Mao and Yifan Zhang and Haochen Tian and Ivan Vulić and Zhang Zhang and Liang Wang and Tieniu Tan and Furu Wei},
journal= {arXiv preprint arXiv:2504.15037},
year = {2025}
}