中文

Joint-MAE:用于3D点云预训练的2D-3D联合掩码自编码器

计算机视觉与模式识别 2023-09-26 v3

摘要

掩码自编码器(MAE)在2D和3D计算机视觉的自监督学习中均展现出有前景的性能。然而,现有的MAE风格方法只能从单一模态的数据(即图像或点云)中学习,忽略了2D和3D之间隐含的语义和几何相关性。本文探索了2D模态如何有益于3D掩码自编码,并提出了Joint-MAE,一个用于自监督3D点云预训练的2D-3D联合MAE框架。Joint-MAE随机掩码输入3D点云及其投影的2D图像,然后重建两个模态的掩码信息。为了实现更好的跨模态交互,我们通过两个层次化的2D-3D嵌入模块、一个联合编码器以及一个包含模态共享和模态特定解码器的联合解码器来构建Joint-MAE。在此基础上,我们进一步引入了两种跨模态策略来增强3D表示学习:用于2D-3D语义线索的局部对齐注意力机制,以及用于2D-3D几何约束的交叉重建损失。通过我们的预训练范式,Joint-MAE在多个下游任务上取得了优越的性能,例如在ModelNet40上线性SVM准确率达到92.4%,在ScanObjectNN最难划分上准确率达到86.07%。

关键词

引用

@article{arxiv.2302.14007,
  title  = {Joint-MAE: 2D-3D Joint Masked Autoencoders for 3D Point Cloud Pre-training},
  author = {Ziyu Guo and Renrui Zhang and Longtian Qiu and Xianzhi Li and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2302.14007},
  year   = {2023}
}

备注

Accepted by IJCAI 2023