中文

通过图像到点掩码自编码器从2D预训练模型学习3D表示

计算机视觉与模式识别 2022-12-14 v1 人工智能

摘要

利用海量图像数据进行预训练已成为鲁棒2D表示的既定范式。相比之下,由于数据采集与标注成本高昂,大规模3D数据集的匮乏严重阻碍了高质量3D特征的学习。本文中,我们提出一种通过图像到点掩码自编码器(称为 I2P-MAE)从2D预训练模型获取优越3D表示的替代方案。通过自监督预训练,我们利用已学好的2D知识引导3D掩码自编码,其以编码器-解码器架构重建被掩码的点的令牌。具体而言,我们首先利用现成的2D模型提取输入点云的多视角视觉特征,然后在其上实施两类图像到点学习方案。其一,我们引入一种2D引导的掩码策略,保持语义重要的点的令牌对编码器可见。相较于随机掩码,网络能更好地聚焦于显著3D结构并从关键空间线索恢复被掩码令牌。其二,我们强制这些可见令牌在解码器后重建对应的多视角2D特征。这使网络能有效继承从丰富图像数据中学到的高层2D语义以用于判别性3D建模。借助我们的图像到点预训练,冻结的 I2P-MAE 无需任何微调即在 ModelNet40 上以线性 SVM 取得 93.4% 准确率,与现有方法的全训练结果相当。通过在 ScanObjectNN 最难划分上进一步微调,I2P-MAE 达到最先进的 90.11% 准确率,超出次优 +3.68%,展现出优越的迁移能力。代码将发布于 https://github.com/ZrrSkywalker/I2P-MAE。

关键词

引用

@article{arxiv.2212.06785,
  title  = {Learning 3D Representations from 2D Pre-trained Models via Image-to-Point Masked Autoencoders},
  author = {Renrui Zhang and Liuhui Wang and Yu Qiao and Peng Gao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2212.06785},
  year   = {2022}
}