中文

从平面到空间:教视觉-语言模型感知与推理 3D

计算机视觉与模式识别 2026-01-13 v7

摘要

大型视觉-语言模型(LVLM)的最新进展提升了视觉-语言理解能力,但它们在空间感知方面仍存在困难,限制了其对复杂 3D 场景的推理能力。以往的方法通过将 3D 表示引入模型来改善空间理解,与此不同,我们的目标是通过利用与空间相关的图像数据来释放视觉-语言模型(VLM)的潜力。为此,我们引入了一种基于带有 3D 真值的场景数据构建的新型 2D 空间数据生成与标注流水线。该流水线能够创建多种空间任务,涵盖从基础感知任务到更复杂的推理任务。利用该流水线,我们构建了 SPAR-7M,一个从多个公开数据集中数千个场景生成的大规模数据集。此外,我们引入了 SPAR-Bench,这是一个旨在比现有空间基准更全面地评估空间能力的基准,支持单视图和多视图输入。在 SPAR-7M 和大规模 2D 数据集上的训练使我们的模型在 2D 空间基准上达到了 SOTA 性能。在 3D 任务特定数据集上的进一步微调产生了有竞争力的结果,凸显了我们的数据集在增强空间推理方面的有效性。

关键词

引用

@article{arxiv.2503.22976,
  title  = {From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D},
  author = {Jiahui Zhang and Yurui Chen and Yanpeng Zhou and Yueming Xu and Ze Huang and Jilin Mei and Junhui Chen and Yu-Jie Yuan and Xinyue Cai and Guowei Huang and Xingyue Quan and Hang Xu and Li Zhang},
  journal= {arXiv preprint arXiv:2503.22976},
  year   = {2026}
}

备注

Project page: https://logosroboticsgroup.github.io/SPAR/