面向点云自监督学习的掩码自编码器
计算机视觉与模式识别
2022-03-29 v2
摘要
作为一种前景广阔的自监督学习方案,掩码自编码已显著推动了自然语言处理与计算机视觉的发展。受此启发,我们提出了一种简洁的掩码自编码器方案用于点云自监督学习,以应对点云特性所带来的挑战,包括位置信息泄露与信息密度不均。具体而言,我们将输入点云划分为不规则的点块并随机以高比例掩码。随后,一个基于标准 Transformer 的、具有非对称设计与移位掩码令牌操作的自编码器从未掩码点块中学习高层潜在特征,旨在重建被掩码的点块。大量实验表明,我们的方法在预训练阶段高效,并能很好地泛化至各类下游任务。具体地,我们的预训练模型在 ScanObjectNN 上达到 85.18% 准确率,在 ModelNet40 上达到 94.04% 准确率,优于所有其他自监督学习方法。我们表明,借助我们的方案,一个完全基于标准 Transformer 的简洁架构可以超越有监督学习中专用的 Transformer 模型。我们的方法在少样本物体分类上也以 1.5%–2.3% 提升了对最先进(SOTA)准确率的突破。此外,我们的工作启发了将来自语言与图像的统一架构应用于点云的可行性。
引用
@article{arxiv.2203.06604,
title = {Masked Autoencoders for Point Cloud Self-supervised Learning},
author = {Yatian Pang and Wenxiao Wang and Francis E. H. Tay and Wei Liu and Yonghong Tian and Li Yuan},
journal= {arXiv preprint arXiv:2203.06604},
year = {2022}
}
备注
https://github.com/Pang-Yatian/Point-MAE