中文

在线跟踪任意 3D 物体的实例分割

计算机视觉与模式识别 2025-12-09 v1

摘要

在线、实时和细粒度的 3D 分割构成了具身智能体感知和理解其操作环境的基本能力。最近的进展采用预定义的对象查询从视觉基础模型(VFM)输出中聚合语义信息,这些输出被升级到 3D 点云,促进通过查询间相互作用的空间信息传播。然而,感知本质上是动态的,使得时间理解成为这些现有查询基础管道中关键但被忽视的维度。因此,为了进一步释放具身智能体的时间环境感知能力,我们的工作重新概念化了在线 3D 分割作为实例跟踪问题(AutoSeg3D)。我们的核心策略是利用对象查询进行时间信息传播,其中长期实例关联促进特征和对象身份的一致性,而短期实例更新丰富即时观察。鉴于具身机器人中的视点变化常导致帧之间部分对象可见性,这一机制有助于模型在超越不完整瞬时视图的基础上发展出整体对象理解。此外,我们引入空间一致性学习以缓解 VFM 固有的碎片化问题,为增强长期和短期时间学习的实例信息提供更全面的信息。由这些稀疏对象查询促进的时间信息交换和一致性学习不仅增强了空间理解,还规避了密集时间点云相互作用所需的计算负担。我们的方法在 ScanNet200 上超过 ESAM 达 2.8 个 AP,并在 ScanNet、SceneNN 和 3RScan 数据集上实现持续提升。

关键词

引用

@article{arxiv.2512.07599,
  title  = {Online Segment Any 3D Thing as Instance Tracking},
  author = {Hanshi Wang and Zijian Cai and Jin Gao and Yiwei Zhang and Weiming Hu and Ke Wang and Zhipeng Zhang},
  journal= {arXiv preprint arXiv:2512.07599},
  year   = {2025}
}

备注

NeurIPS 2025, Code is at https://github.com/AutoLab-SAI-SJTU/AutoSeg3D