中文

SeqVLM:基于 VLM 的面向零样本 3D 视觉定位的提案导向多视角序列推理

计算机视觉与模式识别 2025-08-29 v1 人工智能

摘要

3D 视觉定位 (3DVG) 旨在使用自然语言描述在 3D 场景中定位对象。虽然监督方法在受限环境下实现更高准确率,但零样本 3DVG 因消除场景特定训练需求而在实际应用中具有更大潜力。然而,现有零样本方法因依赖单视图定位,面临空间受限推理、上下文遗漏和细节退化等挑战。为此,我们提出 SeqVLM,一个新型零时 3DVG 框架,利用具有空间信息的多视角真实场景图像进行目标对象推理。具体而言,SeqVLM 首先通过 3D 语义分割网络生成 3D 实例提案,并通过语义过滤进行细化,仅保留与语义相关的候选对象。随后,采用提案导向的多视角投影策略将这些候选提案投影到真实场景图像序列上,在从 3D 点云到图像的转换过程中保留空间关系和上下文细节。此外,为缓解 VLM 计算负担,我们实现了一种动态调度机制,对 sequances-query 提示进行迭代处理,充分利用 VLM 的跨模态推理能力以识别文本指定的对象。在 ScanRefer 和 Nr3D 基准数据集上的实验表明,SeqVLM 实现了最先进的性能,[email protected] 分别达到 55.6% 和 53.2%,分别超过了之前的零时方法 4.0% 和 5.2%,推动了 3DVG 向更广泛的泛化和实际应用迈进。代码已公开:https://github.com/JiawLin/SeqVLM。

关键词

引用

@article{arxiv.2508.20758,
  title  = {SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding},
  author = {Jiawen Lin and Shiran Bian and Yihang Zhu and Wenbin Tan and Yachao Zhang and Yuan Xie and Yanyun Qu},
  journal= {arXiv preprint arXiv:2508.20758},
  year   = {2025}
}