通过文本表示引导推理,释放多模态大语言模型中的空间推理能力
计算机视觉与模式识别
2026-04-21 v2 计算与语言
摘要
现有的多模态大语言模型(MLLMs)在处理3D空间推理方面存在挑战,因其无法构建视频输入所描述的3D环境的结构化抽象。为弥合这一差距,本文受认知理论中相对位置空间推理的启发,探究如何使MLLMs能够对视频的文本化空间表示进行建模与推理。具体而言,我们引入文本化相对位置上下文从第三人称视频生成的表示方法(TRACE),该方法通过引导MLLMs生成3D环境的文本化表示作为中间推理痕迹,以实现更准确的空间问答。TRACE编码了元语境、相机轨迹和详细物体实体,以支持对第三人称视角视频的结构化空间推理。大量实验在VSI-Bench和OST-Bench上表明,TRACE在多样化的MLLM主干网络(包括不同参数规模和训练架构)上,均显著优于先前的提示策略。我们进一步提供了消融研究以验证设计选择,并对MLLMs的3D空间推理瓶颈进行了详细分析。
引用
@article{arxiv.2603.23404,
title = {Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning},
author = {Jiacheng Hua and Yishu Yin and Yuhang Wu and Tai Wang and Yifei Huang and Miao Liu},
journal= {arXiv preprint arXiv:2603.23404},
year = {2026}
}
备注
Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io