中文

基于点特征增强掩码自编码器的紧凑 3D 表征学习

计算机视觉与模式识别 2023-12-19 v1

摘要

在基于掩码自编码器 (MAE) 的点云预训练方法(包括单模态和跨模态 MAE)中,学习 3D 表征起着至关重要的作用。具体而言,尽管跨模态 MAE 方法通过其他模态知识的辅助学习到了强大的 3D 表征,但它们通常面临沉重的计算负担,并且严重依赖于通常难以获取的海量跨模态数据对,这阻碍了它们在实际中的应用。相反,仅以点云作为输入的单模态方法因其简单性和效率而在实际应用中更受青睐。然而,此类方法在全局随机掩码输入下容易受到 3D 表征受限的困扰。为了学习紧凑的 3D 表征,我们提出了一种简单而有效的点特征增强掩码自编码器 (Point-FEMAE),它主要由一个全局分支和一个局部分支组成,以捕获潜在的语义特征。具体而言,为了学习更紧凑的特征,引入了一个共享参数的 Transformer 编码器,从由全局随机和局部块掩码策略获得的全局和局部未掩码块中提取点特征,随后通过特定的解码器进行重建。同时,为了进一步增强局部分支中的特征,我们提出了一个带有局部块卷积的局部增强模块,以在更大尺度上感知细粒度的局部上下文。与跨模态方法相比,我们的方法显著提高了预训练效率,并且广泛的下游实验突显了其最先进的 (SOTA) 有效性,特别是在 ScanObjectNN 的三个变体中分别比我们的基线 (Point-MAE) 高出 5.16%、5.00% 和 5.04%。代码可在 https://github.com/zyh16143998882/AAAI24-PointFEMAE 获取。

关键词

引用

@article{arxiv.2312.10726,
  title  = {Towards Compact 3D Representations via Point Feature Enhancement Masked Autoencoders},
  author = {Yaohua Zha and Huizhen Ji and Jinmin Li and Rongsheng Li and Tao Dai and Bin Chen and Zhi Wang and Shu-Tao Xia},
  journal= {arXiv preprint arXiv:2312.10726},
  year   = {2023}
}

备注

Accepted to AAAI 2024