中文

HVDistill:通过无监督混合视图蒸馏将知识从图像迁移至点云

计算机视觉与模式识别 2024-03-20 v1

摘要

我们提出了一种基于混合视图的知识蒸馏框架,称为 HVDistill,以无监督方式利用预训练图像网络指导点云神经网络的特征学习。通过利用 RGB 相机和 LiDAR 传感器之间的几何关系,可以建立基于图像平面视图和鸟瞰图的双模态对应关系,从而促进表示学习。具体而言,图像平面对应关系可以通过投影点云简单获得,而鸟瞰图对应关系则可以通过在投影点云的监督下利用预测深度将像素提升至 3D 空间来实现。图像教师网络从图像平面视图提供丰富的语义,同时从鸟瞰图获取几何信息。事实上,来自这两个视图的图像特征自然互补,能够共同改善点云学生网络学习到的特征表示。此外,借助自监督预训练的 2D 网络,HVDistill 既不需要 2D 也不需要 3D 标注。我们在 nuScenes 数据集上预训练我们的模型,并将其迁移到 nuScenes、SemanticKITTI 和 KITTI 数据集上的多个下游任务进行评估。大量实验结果表明,我们的方法相较于从零开始训练的基线取得了一致的改进,并显著优于现有方案。代码可在 [email protected]:zhangsha1024/HVDistill.git 获取。

关键词

引用

@article{arxiv.2403.11817,
  title  = {HVDistill: Transferring Knowledge from Images to Point Clouds via Unsupervised Hybrid-View Distillation},
  author = {Sha Zhang and Jiajun Deng and Lei Bai and Houqiang Li and Wanli Ouyang and Yanyong Zhang},
  journal= {arXiv preprint arXiv:2403.11817},
  year   = {2024}
}