Point-M2AE:面向分层点云预训练的多尺度掩码自编码器
计算机视觉与模式识别
2022-10-17 v2 人工智能
摘要
掩码自编码器(MAE)在语言和2D图像Transformer的自监督预训练中已展现出巨大潜力。然而,如何利用掩码自编码来学习不规则点云的3D表示仍是一个开放性问题。本文提出Point-M2AE,一种用于3D点云分层自监督学习的强大多尺度MAE预训练框架。与MAE中的标准Transformer不同,我们将编码器和解码器修改为金字塔架构,以逐步建模空间几何并捕获3D形状的细粒度与高层语义。对于按阶段下采样点令牌的编码器,我们设计了一种多尺度掩码策略以在各尺度间生成一致的可见区域,并在微调时采用局部空间自注意力机制来关注邻域模式。通过多尺度令牌传播,轻量级解码器利用来自编码器的互补跳跃连接逐步上采样点令牌,进一步从全局到局部的视角促进重建。大量实验证明了Point-M2AE在3D表示学习中的最先进性能。预训练后冻结编码器,Point-M2AE在ModelNet40上以线性SVM达到92.9%的准确率,甚至超越部分全训练方法。通过在下游任务上微调,Point-M2AE在ScanObjectNN上达到86.43%的准确率,比次优方法高+3.36%,并借助分层预训练方案大幅惠及少样本分类、部件分割与3D目标检测。代码见 https://github.com/ZrrSkywalker/Point-M2AE。
引用
@article{arxiv.2205.14401,
title = {Point-M2AE: Multi-scale Masked Autoencoders for Hierarchical Point Cloud Pre-training},
author = {Renrui Zhang and Ziyu Guo and Rongyao Fang and Bin Zhao and Dong Wang and Yu Qiao and Hongsheng Li and Peng Gao},
journal= {arXiv preprint arXiv:2205.14401},
year = {2022}
}
备注
NeurIPS 2022