OpenTrack3D:面向准确且通用的开放词汇 3D 实例分割
计算机视觉与模式识别
2026-05-15 v3
摘要
将开放词汇 3D 实例分割(OV-3DIS)推广至多样化、非结构化且无网格的环境对于机器人和 AR/VR 至关重要,却仍是重大挑战。我们认为现有方法的两个关键局限性导致此挑战:(1) 提案生成依赖于数据特定的提案网络或基于网格的超点,使其在无网格场景下不可用且限制对新场景的泛化;(2) 基于 CLIP 的分类器在文本推理方面薄弱,难以识别由用户查询构成的组合式查询。为此,我们引入 OpenTrack3D,一个通用且高精度的框架。不同于依赖预生成提案的方法,OpenTrack3D 采用新颖的视觉-空间跟踪器在线构建跨视图一致的目标提案。给定 RGB-D 流, our pipeline 首先利用 2D 开放词汇分割器生成掩码,再利用深度信息将其提升至 3D 点云。掩码引导的实例特征随 DINO 特征图提取,然后我们的跟踪器融合视觉与空间线索以维持实例一致性。核心管道完全无网格,亦提供可选的超点细化模块以在场景网格可用时进一步提升性能。最后,我们用多模态大语言模型(MLLM)取代 CLIP,显著提升对复杂用户查询的组合推理能力。广泛的实验在包括 ScanNet200、Replica、ScanNet++ 和 SceneFun3D 在内的多样化基准数据集上表现出最先进的性能和强大的泛化能力。
引用
@article{arxiv.2512.03532,
title = {OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation},
author = {Zhishan Zhou and Siyuan Wei and Zengran Wang and Chunjie Wang and Xiaosheng Yan and Xiao Liu},
journal= {arXiv preprint arXiv:2512.03532},
year = {2026}
}