中文

OpenMask3D:开放词汇三维实例分割

计算机视觉与模式识别 2023-10-31 v2

摘要

我们提出了开放词汇三维实例分割任务。当前的三维实例分割方法通常只能识别训练数据集中标注的预定义封闭类别集合中的物体类别。这导致在现实世界应用中存在重要局限,其中人们可能需要执行由与各种物体相关的新颖、开放词汇查询所引导的任务。近来,开放词汇三维场景理解方法通过为场景中每个点学习可查询特征来解决此问题。虽然这种表示可直接用于语义分割,现有方法无法分离多个物体实例。在本工作中,我们解决此局限,并提出 OpenMask3D,一种用于开放词汇三维实例分割的零样本方法。在预测的类无关三维实例掩码引导下,我们的模型通过基于 CLIP 的图像嵌入的多视图融合来聚合每掩码特征。在 ScanNet200 和 Replica 上的实验与消融研究表明 OpenMask3D 优于其他开放词汇方法,尤其在长尾分布上。定性实验进一步展示了 OpenMask3D 基于描述几何、功能可供性与材料的自由形式查询来分割物体属性的能力。

关键词

引用

@article{arxiv.2306.13631,
  title  = {OpenMask3D: Open-Vocabulary 3D Instance Segmentation},
  author = {Ayça Takmaz and Elisabetta Fedele and Robert W. Sumner and Marc Pollefeys and Federico Tombari and Francis Engelmann},
  journal= {arXiv preprint arXiv:2306.13631},
  year   = {2023}
}

备注

NeurIPS 2023. Project page: https://openmask3d.github.io/