中文

CLIP2Scene:利用CLIP实现标签高效的3D场景理解

计算机视觉与模式识别 2023-04-07 v2

摘要

对比语言-图像预训练(CLIP)在2D零样本和小样本学习中取得了令人瞩目的成果。尽管在2D领域表现卓越,但应用CLIP辅助3D场景理解学习仍有待探索。在本文中,我们首次尝试研究CLIP知识如何有益于3D场景理解。我们提出了CLIP2Scene,一个简单而有效的框架,将CLIP知识从2D图像-文本预训练模型迁移到3D点云网络。我们表明,预训练的3D网络在各种下游任务上取得了令人印象深刻的性能,即无标注和有标注数据的语义分割微调。具体而言,基于CLIP,我们设计了一个语义驱动的跨模态对比学习框架,通过语义和时空一致性正则化预训练3D网络。对于前者,我们首先利用CLIP的文本语义选择正负点样本,然后使用对比损失训练3D网络。对于后者,我们强制时间一致的点云特征与其对应的图像特征之间的一致性。我们在SemanticKITTI、nuScenes和ScanNet上进行了实验。我们的预训练网络首次在nuScenes和ScanNet上分别实现了20.8%和25.08% mIoU的无标注3D语义分割。当使用1%或100%的标注数据进行微调时,我们的方法显著优于其他自监督方法,mIoU分别提升了8%和1%。此外,我们展示了处理跨域数据集的泛化能力。代码已公开在https://github.com/runnanchen/CLIP2Scene。

关键词

引用

@article{arxiv.2301.04926,
  title  = {CLIP2Scene: Towards Label-efficient 3D Scene Understanding by CLIP},
  author = {Runnan Chen and Youquan Liu and Lingdong Kong and Xinge Zhu and Yuexin Ma and Yikang Li and Yuenan Hou and Yu Qiao and Wenping Wang},
  journal= {arXiv preprint arXiv:2301.04926},
  year   = {2023}
}

备注

CVPR 2023