在任何点云上自监督预训练 3D 特征
计算机视觉与模式识别
2021-01-08 v1
摘要
在大型标注数据集上预训练是在许多计算机视觉任务(如 2D 目标识别、视频分类等)中取得良好表现的先决条件。然而,预训练并未广泛用于 3D 识别任务,其中最先进的方法从零开始训练模型。一个主要原因是缺乏大型标注数据集,因为 3D 数据既难以获取又标注耗时。我们提出了一种简单的自监督预训练方法,可处理任意 3D 数据——单视图或多视图、室内或室外、由不同传感器获取、无需 3D 配准。我们预训练标准的点云与基于体素的模型架构,并展示联合预训练可进一步提升性能。我们在 9 个用于目标检测、语义分割与目标分类的基准上评估我们的模型,它们取得了最先进结果且能优于有监督预训练。我们在 ScanNet(69.0% mAP)和 SUNRGBD(63.5% mAP)上确立了目标检测的新最先进水平。我们的预训练模型具有标签高效性,并改善了少样本类别的性能。
引用
@article{arxiv.2101.02691,
title = {Self-Supervised Pretraining of 3D Features on any Point-Cloud},
author = {Zaiwei Zhang and Rohit Girdhar and Armand Joulin and Ishan Misra},
journal= {arXiv preprint arXiv:2101.02691},
year = {2021}
}