中文

弱监督三维开放词汇分割

计算机视觉与模式识别 2024-01-10 v4

摘要

三维场景的开放词汇分割是人类感知的基本功能,因而是计算机视觉研究中的一个关键目标。然而,该任务严重受限于缺乏用于训练鲁棒且可泛化模型的大规模多样化三维开放词汇分割数据集。从预训练的二维开放词汇分割模型蒸馏知识有所帮助,但由于二维模型大多使用封闭词汇数据集微调,这会损害开放词汇特征。我们通过以弱监督方式利用预训练基础模型 CLIP 与 DINO 来解决三维开放词汇分割中的挑战。具体而言,给定场景中物体仅有的开放词汇文本描述,我们将 CLIP 与 DINO 的开放词汇多模态知识与物体推理能力蒸馏至神经辐射场(NeRF)中,从而有效地将二维特征提升为视角一致的三维分割。我们方法的一个显著特点是,无论对基础模型还是蒸馏过程,都不需要任何人工分割标注。大量实验表明,我们的方法在某些场景中甚至优于使用分割标注训练的全监督模型,这表明三维开放词汇分割可以有效地从二维图像与文本-图像对中学习。代码见 \url{https://github.com/Kunhao-Liu/3D-OVS}。

关键词

引用

@article{arxiv.2305.14093,
  title  = {Weakly Supervised 3D Open-vocabulary Segmentation},
  author = {Kunhao Liu and Fangneng Zhan and Jiahui Zhang and Muyu Xu and Yingchen Yu and Abdulmotaleb El Saddik and Christian Theobalt and Eric Xing and Shijian Lu},
  journal= {arXiv preprint arXiv:2305.14093},
  year   = {2024}
}

备注

Accepted to NeurIPS 2023