细察 3D 视觉自监督预训练中的不变性
计算机视觉与模式识别
2022-07-14 v2
摘要
近年来,3D 视觉的自监督预训练引起了日益增长的研究兴趣。为学习信息丰富的表示,许多先前工作利用了 3D 特征的不变性,例如同一场景不同视角间的透视不变性、深度图与 RGB 图像间的模态不变性、点云与体素间的格式不变性。尽管取得了有前景的结果,先前研究缺乏对这些不变性的系统且公平的比较。为解决此问题,我们的工作首次引入了一个统一框架,在此框架下可研究各种预训练方法。我们进行了大量实验,并细察了不同不变性在 3D 预训练中的贡献。此外,我们提出了一种简单而有效的方法,使用对比学习联合预训练一个 3D 编码器和一个深度图编码器。用我们的方法预训练的模型在下游任务中获得了显著的性能提升。例如,预训练的 VoteNet 在 SUN RGB-D 和 ScanNet 目标检测基准上以明显优势超越先前方法。
引用
@article{arxiv.2207.04997,
title = {A Closer Look at Invariances in Self-supervised Pre-training for 3D Vision},
author = {Lanxiao Li and Michael Heizmann},
journal= {arXiv preprint arXiv:2207.04997},
year = {2022}
}
备注
Accepted on ECCV 2022