PCP-MAE:学习预测点掩码自编码器的中心
计算机视觉与模式识别
2024-10-25 v2
摘要
掩码自编码器已在点云自监督学习中被广泛探索,其中点云通常被划分为可见部分和掩码部分。这些方法通常包括一个接受可见块(归一化)及其对应块中心(位置)作为输入的编码器,以及一个接受编码器输出和掩码部分中心(位置)来重建掩码块中每个点的解码器。然后,预训练的编码器被用于下游任务。在本文中,我们展示了一个具有启发性的经验结果:当在不提供编码器信息的情况下直接将掩码块的中心输入解码器时,仍然能够很好地重建。换句话说,块中心是重要的,重建目标并不一定依赖于编码器的表示,从而防止编码器学习语义表示。基于这一关键观察,我们提出了一种简单而有效的方法,即学习预测点掩码自编码器的中心(PCP-MAE),该方法引导模型学习预测显著的中心,并使用预测的中心来替代直接提供的中心。具体而言,我们提出了一种预测中心模块(PCM),该模块与原始编码器共享参数并附加交叉注意力来预测中心。与其他替代方法相比,我们的方法具有较高的预训练效率,并在3D物体分类任务上取得了显著提升,特别是在ScanObjectNN数据集上,在OBJ-BG上超越Point-MAE 5.50%,在OBJ-ONLY上超越6.03%,在PB-T50-RS上超越5.17%。代码可在https://github.com/aHapBean/PCP-MAE获取。
引用
@article{arxiv.2408.08753,
title = {PCP-MAE: Learning to Predict Centers for Point Masked Autoencoders},
author = {Xiangdong Zhang and Shaofeng Zhang and Junchi Yan},
journal= {arXiv preprint arXiv:2408.08753},
year = {2024}
}