面向空间智能的 MLLMs 泛化能力研究
计算机视觉与模式识别
2026-03-10 v1 机器学习
摘要
直接处理 RGB 输入的多模态大语言模型(MLLMs)在 3D 定位和导航等任务中显示出惊人的潜力。然而,我们认为这些仅依赖 RGB 的方法在跨摄像机泛化能力方面存在根本性缺陷。通过忽略摄像机参数,这些方法将物体的物理属性与摄像机视角相结合,导致不可调和的歧义。我们表明,这导致 MLLMs 对训练摄像机分布进行过拟合,而非学习真正可泛化的 3D 几何原理。为此,我们提出了面向空间 MLLMs 的摄像机感知框架。它通过以下方式学习可泛化的空间推理:(i) 通过稠密嵌入注入摄像机内参,以条件化每个视觉标记;(ii) 引入摄像机感知数据增强策略,通过人工变异摄像机参数迫使模型解耦摄像机属性与场景内容;(iii) 从 3D 视觉基础模型蒸馏几何先验。广泛的实验表明,摄像机感知 MLLMs 在跨摄像机泛化测试中显著优于其不敏感的对手,尤其是在空间导向任务上,表明摄像机感知不仅有益,而且是实现 MLLMs 稳健且可泛化空间智能的必要条件。
引用
@article{arxiv.2603.06704,
title = {On the Generalization Capacities of MLLMs for Spatial Intelligence},
author = {Gongjie Zhang and Wenhao Li and Quanhao Qian and Jiuniu Wang and Deli Zhao and Shijian Lu and Ran Xu},
journal= {arXiv preprint arXiv:2603.06704},
year = {2026}
}
备注
ICLR 2026 (Oral)