中文

基于2D图像知识蒸馏的3D点云预训练

计算机视觉与模式识别 2022-12-20 v1

摘要

近期预训练2D视觉模型取得的成功,主要归功于从大规模数据集中学习。然而,与2D图像数据集相比,当前3D点云的预训练数据十分有限。为克服这一局限,我们提出了一种针对3D点云预训练模型的知识蒸馏方法,通过概念对齐,直接从2D表示学习模型(尤其是CLIP的图像编码器)中获取知识。具体而言,我们引入了一种交叉注意力机制,从3D点云中提取概念特征,并将其与2D图像的语义信息进行比较。在此方案下,点云预训练模型直接从2D教师模型所包含的丰富信息中学习。大量实验表明,所提出的知识蒸馏方案在下游任务(包括物体分类、目标检测、语义分割和部件分割)的合成数据集和真实世界数据集上,均取得了比当前最先进的3D预训练方法更高的准确率。

关键词

引用

@article{arxiv.2212.08974,
  title  = {3D Point Cloud Pre-training with Knowledge Distillation from 2D Images},
  author = {Yuan Yao and Yuanhan Zhang and Zhenfei Yin and Jiebo Luo and Wanli Ouyang and Xiaoshui Huang},
  journal= {arXiv preprint arXiv:2212.08974},
  year   = {2022}
}