中文

将显式对比性质引入掩码自编码器,用于点云自监督学习

计算机视觉与模式识别 2024-07-09 v1

摘要

计算机视觉中基于视觉变换器(ViT)的对比学习(CL)已取得与传统卷积骨干网络相当的性能。然而在基于ViT的3D点云预训练中,掩码自编码器(MAE)建模仍占主导地位。这引出一个问题:我们能否两全其美?为回答此问,首先我们经验性地验证,即使经过严谨设计,将MAE基点云预训练与标准对比学习范式相结合,仍可能导致性能下降。为克服此限制,我们通过利用MAE固有的对比性质,将对比学习重新引入MAE基点云预训练范式。具体做法是,无需图像领域常用的大量数据增强,而是对输入token随机遮蔽两次以生成对比输入对。随后,采用权共享编码器和两个结构相同的解码器进行掩码token重建。此外,我们提出,对于被两个遮蔽同时掩盖的输入token,其重建特征应尽可能相似。这自然地在基于生成式MAE的预训练范式中建立明确的对比约束,形成我们提出的方法Point-CMAE。因此,Point-CMAE有效提升了表示质量和迁移性能。实验评估包括分类、部分分割和few-shot学习等多种下游任务,均显示出在标准ViT和单模态设置下,本框架优于当前最先进技术。源代码和训练好的模型均可在 https://github.com/Amazingren/Point-CMAE 查阅。

关键词

引用

@article{arxiv.2407.05862,
  title  = {Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-Supervised Learning},
  author = {Bin Ren and Guofeng Mei and Danda Pani Paudel and Weijie Wang and Yawei Li and Mengyuan Liu and Rita Cucchiara and Luc Van Gool and Nicu Sebe},
  journal= {arXiv preprint arXiv:2407.05862},
  year   = {2024}
}

备注

Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-Supervised Learning