中文

从 2D 学习:面向 3D 预训练的对比像素到点知识迁移

计算机视觉与模式识别 2021-12-28 v3

摘要

由于缺乏大规模标注 3D 数据集,大多数 3D 神经网络从头开始训练。在本文中,我们提出一种利用从丰富 2D 数据集学习到的 2D 网络的新颖 3D 预训练方法。我们提出对比像素到点知识迁移,通过将像素级和点级特征映射到同一嵌入空间来有效利用 2D 信息。由于 2D 和 3D 网络之间的异构性,我们引入反投影函数以对齐 2D 和 3D 之间的特征,使迁移成为可能。此外,我们设计了一个上采样特征投影层以提高高层 2D 特征图的空间分辨率,从而能够学习细粒度 3D 表示。借助预训练的 2D 网络,所提出的预训练过程不需要额外的 2D 或 3D 标注数据,进一步缓解了昂贵的 3D 数据标注成本。据我们所知,我们是首个利用现有 2D 训练权重来预训练 3D 深度神经网络的工作。我们的大量实验表明,用 2D 知识预训练的 3D 模型提升了 3D 网络在各种真实世界 3D 下游任务中的性能。

关键词

引用

@article{arxiv.2104.04687,
  title  = {Learning from 2D: Contrastive Pixel-to-Point Knowledge Transfer for 3D Pretraining},
  author = {Yueh-Cheng Liu and Yu-Kai Huang and Hung-Yueh Chiang and Hung-Ting Su and Zhe-Yu Liu and Chin-Tang Chen and Ching-Yu Tseng and Winston H. Hsu},
  journal= {arXiv preprint arXiv:2104.04687},
  year   = {2021}
}