中文

FOLK:基于标签引导的快速开放词汇 3D 实例分割

计算机视觉与模式识别 2025-10-13 v1

摘要

开放词汇 3D 实例分割旨在超越已标注标签空间对实例进行分割和分类。现有方法通常将 3D 实例映射到 2D RGB-D 图像,然后采用视觉语言模型(VLM)进行分类。然而,这种映射策略通常会引入 2D 遮挡的噪声,并在推理期间造成巨大的计算和内存开销,降低推理速度。为解决上述问题,我们提出一种通过标签引导知识蒸馏实现快速开放词汇 3D 实例分割的方法(FOLK)。我们的核心思想是设计一个教师模型,从而提取高质量的实例嵌入并将其开放词汇知识蒸馈到 3D 学生模型中。如此一来,在推理时,蒸馈后的 3D 模型即可直接从 3D 点云中对实例进行分类,避免遮挡引入的噪声,并显著加快推理过程。具体而言,我们首先设计教师模型为每个 3D 实例生成 2D CLIP 嵌入,纳入可见性和视点多样性,作为蒸馈的学习目标。随后,我们开发 3D 学生模型,直接为每个 3D 实例产生 3D 嵌入。在训练期间,我们提出一种标签引导蒸馈算法,将标签一致的 2D 嵌入中的开放词汇知识蒸馈到学生模型。FOLK 在 ScanNet200 和 Replica 数据集上进行实验,在 ScanNet200 数据集上实现了最先进的性能,AP50 分数为 35.7,而推理速度比以前的方法快 6.0 倍到 152.2 倍。所有代码将在论文接受后发布。

关键词

引用

@article{arxiv.2510.08849,
  title  = {FOLK: Fast Open-Vocabulary 3D Instance Segmentation via Label-guided Knowledge Distillation},
  author = {Hongrui Wu and Zhicheng Gao and Jin Cao and Kelu Yao and Wen Shen and Zhihua Wei},
  journal= {arXiv preprint arXiv:2510.08849},
  year   = {2025}
}