中文

GroundFlow:面向 3D 点云序列定位的时序推理插件模块

计算机视觉与模式识别 2025-09-23 v3

摘要

3D 点云序列定位 (SG3D) 指按照日常活动中详细步骤的文本指令依次定位物体序列。当前 3D 视觉定位 (3DVG) 方法将包含多步骤文本指令整体处理,却未从每一步中提取有效时序信息。然而,SG3D 中的指令常包含指代词如 "it"、"here" 和 "the same" 以简化语言表达,这要求定位方法理解上下文,从前一步检索相关信息以正确定位物体序列。由于缺乏有效的历史信息收集模块,领先的 3DVG 方法在适应 SG3D 任务时面临巨大挑战。为填补这一空白,我们提出了 GroundFlow——一个用于 3D 点云序列定位时序推理的插件模块。首先,我们证明将 GroundFlow 集成后,可在 SG3D 基准测试中显著提升 3DVG 基线方法的准确率(分别提升 +7.5\% 和 +10.2\%),甚至超越在多数据集上预训练的 3D 大语言模型。进一步,我们基于当前指令的相关性,选择性地提取短期和长期步骤信息,使 GroundFlow 能综合把握历史信息,并在步骤数量增加时保持时序理解优势。总体而言,我们的工作为现有 3DVG 模型引入时序推理能力,实现了在五个数据集上的 SG3D 基准测试的最新性能。

关键词

引用

@article{arxiv.2506.21188,
  title  = {GroundFlow: A Plug-in Module for Temporal Reasoning on 3D Point Cloud Sequential Grounding},
  author = {Zijun Lin and Shuting He and Cheston Tan and Bihan Wen},
  journal= {arXiv preprint arXiv:2506.21188},
  year   = {2025}
}