面向空间智能的双路径几何感知多模态大语言模型
计算机视觉与模式识别
2026-05-26 v1
摘要
从二维视觉输入理解物理世界的空间信息依赖于两种互补的几何知识形式:整体三维结构感知和细粒度度量尺度估计。现有的多模态大语言模型通常只处理其中一个方面,将深度图或点云作为额外的模型输入,这带来了大量的计算开销,并继承了上游预测模型的泛化局限性。我们提出GAMSI,一种面向空间智能的双路径几何感知多模态大语言模型,它仅以RGB图像作为输入,同时在统一的自回归骨干网络内内化两种几何先验。具体来说,我们引入了度量-结构解耦查询,它使用两组可学习查询分别从共享的视觉上下文中提取密集的度量信号和稀疏的结构线索,并采用任务解耦注意力掩码进一步防止两条路径相互干扰。在此基础上,专家引导的视觉定位模块将聚合的线索投影回帧级视觉特征,并将其与视觉基础模型对齐,这些模型仅作为训练时的监督,而非模型输入。我们进一步构建了一个多任务空间指令微调数据集,包含152,776个样本,涵盖13种任务类型和三种视觉模态,整合自六个公开数据集。通过两阶段课程训练,GAMSI在七个空间智能基准测试中达到了最先进的性能。
引用
@article{arxiv.2605.25334,
title = {Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence},
author = {Yufei Zheng and Xuhan Zhu and Zide Liu and Chunpeng Zhou and Chenfeng Wang and Yongchao Xu and Yunnan Wang and Jiawei Liu and Pengfei Yu and Wei Zhai and Yang Cao and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2605.25334},
year = {2026}
}