中文

Take-A-Photo: 点云模型的3D到2D生成式预训练

计算机视觉与模式识别 2023-09-08 v2 人工智能 机器学习

摘要

在MAE引领的掩码图像建模浪潮下,生成式预训练已展现出提升2D视觉基础模型性能的显著潜力。然而在3D视觉中,对基于Transformer骨干网络的过度依赖以及点云的无序性限制了生成式预训练的进一步发展。本文提出一种适用于任意点云模型的新型3D到2D生成式预训练方法。我们提出以通过交叉注意力机制从不同指定姿态生成视图图像作为预训练方案。生成视图图像比其点云对应任务具有更精确的监督,从而协助3D骨干网络更精细地理解点云几何结构与立体关系。实验结果证明了我们所提3D到2D生成式预训练相对于先前预训练方法的优越性。我们的方法在提升面向架构的方法性能方面同样有效,在ScanObjectNN分类与ShapeNetPart分割任务微调时取得了最先进的性能。代码见 https://github.com/wangzy22/TAP。

关键词

引用

@article{arxiv.2307.14971,
  title  = {Take-A-Photo: 3D-to-2D Generative Pre-training of Point Cloud Models},
  author = {Ziyi Wang and Xumin Yu and Yongming Rao and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2307.14971},
  year   = {2023}
}

备注

Accepted to ICCV 2023, project page: https://tap.ivg-research.xyz