中文

PanoGrounder:用于 VLM 基于 3D 视觉定位的全景场景表示桥接

计算机视觉与模式识别 2025-12-25 v1

摘要

3D视觉定位(3DVG)是从视觉语言感知到机器人之间的关键桥梁,要求具备语言理解和3D场景推理能力。传统监督模型利用显式3D几何,但由于3D视觉语言数据稀缺以及与现代视觉语言模型(VLM)相比推理能力有限,泛化能力受限。我们提出PanoGrounder,一个通用3DVG框架,将多模态全景表示与预训练2D VLM 进行耦合,以实现强大的视觉语言推理。全景渲染图经过3D语义和几何特征增强,作为2D与3D之间的中间表示,具有两个主要优势:(i)可直接输入VLM,仅需最小适配;(ii)凭借360度视场保留长程物体间关系。我们设计了一个三阶段流程:考虑场景布局和几何特性,放置一组紧凑的全景视点;在每个全景渲染图上对文本查询进行定位;通过升维将各视图预测融合为单个3D边界框。我们的方法在ScanRefer和Nr3D上实现了最先进的成绩,并在未见3D数据集和文本改写方面表现出优异的泛化能力。

关键词

引用

@article{arxiv.2512.20907,
  title  = {PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding},
  author = {Seongmin Jung and Seongho Choi and Gunwoo Jeon and Minsu Cho and Jongwoo Lim},
  journal= {arXiv preprint arXiv:2512.20907},
  year   = {2025}
}