中文

GD-MAE:用于激光雷达点云MAE预训练的生成式解码器

计算机视觉与模式识别 2023-03-20 v3

摘要

尽管掩码自编码器(Masked Autoencoders, MAE)在图像与视频等视觉任务中取得了巨大进展,但由于三维点云固有的不规则性,在大规模三维点云中探索MAE仍具挑战。以往的三维MAE框架要么设计复杂的解码器从保留区域推断掩码信息,要么采用精细的掩码策略,我们则提出了一种更简单的范式。其核心思想是为MAE应用一个生成式解码器(Generative Decoder for MAE, GD-MAE),以分层融合方式自动合并周围上下文来恢复被掩码的几何知识。如此,我们的方法无需引入启发式解码器设计,并可灵活探索多种掩码策略。相应部分相比常规方法延迟降低不到12%,同时取得更优性能。我们在多个大规模基准上验证了所提方法的有效性:Waymo、KITTI与ONCE。下游检测任务上的一致提升表明了强大的鲁棒性与泛化能力。我们的方法不仅取得了最先进(state-of-the-art)结果,而且在Waymo数据集上仅使用20%的标注数据便达到了可比精度。代码将发布于https://github.com/Nightmare-n/GD-MAE。

关键词

引用

@article{arxiv.2212.03010,
  title  = {GD-MAE: Generative Decoder for MAE Pre-training on LiDAR Point Clouds},
  author = {Honghui Yang and Tong He and Jiaheng Liu and Hua Chen and Boxi Wu and Binbin Lin and Xiaofei He and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2212.03010},
  year   = {2023}
}

备注

CVPR2023