中文

POS-BERT:点云单阶段 BERT 预训练

计算机视觉与模式识别 2022-04-05 v1

摘要

近来,结合 Transformer 与掩码语言建模的预训练范式在 NLP、图像和点云(如 BERT)中取得了巨大成功。然而,将 BERT 从 NLP 直接扩展到点云需要在预训练前训练一个固定的离散变分自编码器(dVAE),这导致了一种称为 Point-BERT 的复杂两阶段方法。受 BERT 与 MoCo 启发,我们提出 POS-BERT,一种用于点云的单阶段 BERT 预训练方法。具体而言,我们使用掩码块建模(MPM)任务进行点云预训练,旨在对应 tokenizer 输出的监督下恢复被掩码块的信息。与 Point-BERT 不同,其 tokenizer 是额外训练且冻结的。我们提出使用动态更新的动量编码器作为 tokenizer,其随训练过程更新并输出动态监督信号。进一步,为学习高级语义表示,我们结合对比学习以最大化不同变换点云间类令牌的一致性。大量实验表明,POS-BERT 可提取高质量预训练特征并提升下游任务性能。使用未经任何微调的预训练模型提取特征并在 ModelNet40 上训练线性 SVM,POS-BERT 达到了最先进的分类准确率,超越 Point-BERT 达 3.5%。此外,我们的方法显著改进了许多下游任务,如微调分类、少样本分类、部件分割。代码与训练模型将发布于:\url{https://github.com/fukexue/POS-BERT}。

关键词

引用

@article{arxiv.2204.00989,
  title  = {POS-BERT: Point Cloud One-Stage BERT Pre-Training},
  author = {Kexue Fu and Peng Gao and ShaoLei Liu and Renrui Zhang and Yu Qiao and Manning Wang},
  journal= {arXiv preprint arXiv:2204.00989},
  year   = {2022}
}