中文

COOPER:空间智能中协同感知与推理的统一模型

计算机视觉与模式识别 2025-12-08 v2

摘要

视觉空间推理对于使多模态大语言模型(MLLM)理解对象属性和空间关系至关重要,但当前模型仍在3D感知推理方面受限。现有方法通常通过增强RGB输入以辅助模态(如深度和分割)来提升感知,或通过训练空间VQA数据集并应用强化学习来提升推理,因而将这两个方面孤立地对待。本文我们探讨了统一MLLM是否能够发展内在的感知能力以增强空间感知,并通过自适应交错推理实现更强的空间智能。我们提出了COOPER,一种统一MLLM,利用深度和分割作为辅助模态,并采用两阶段训练以获取辅助模态生成和自适应交错推理能力。COOPER在空间推理中实现了平均6.91%的提升,同时保持了通用性能。此外,仅为辅助模态生成而训练的变体在距离和大小估计方面实现了7.92%的提升,表明学习生成辅助模态有助于内化空间知识并加强空间理解。

关键词

引用

@article{arxiv.2512.04563,
  title  = {COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence},
  author = {Zefeng Zhang and Xiangzhao Hao and Hengzhu Tang and Zhenyu Zhang and Jiawei Sheng and Xiaodong Li and Zhenyang Li and Li Gao and Daiting Shi and Dawei Yin and Tingwen Liu},
  journal= {arXiv preprint arXiv:2512.04563},
  year   = {2025}
}