中文

PRED:基于激光雷达点云语义渲染的预训练

计算机视觉与模式识别 2023-11-09 v1

摘要

在自动驾驶等 3D 相关领域中,点云标注成本高且困难,预训练至关重要。然而,许多近期点云预训练研究忽视了不完整性问题,即激光雷达仅捕获部分点,导致训练阶段存在歧义。另一方面,图像提供更全面的信息与更丰富的语义,可增强点云编码器以解决点云固有的不完整问题。但是,由于遮挡可能导致点与像素错位,将图像引入点云预训练面临自身挑战。本文提出 PRED,一种以遮挡感知方式面向室外点图像辅助预训练框架。我们框架的核心是基于鸟瞰图(BEV)特征图的条件语义渲染,利用图像语义通过神经渲染进行监督。我们进一步通过引入点级掩码(掩码率 95%)提升模型性能。大量实验证明 PRED 优于先前的点云预训练方法,在各种大规模 3D 感知任务数据集上提供显著提升。代码将发布于 https://github.com/PRED4pc/PRED。

关键词

引用

@article{arxiv.2311.04501,
  title  = {PRED: Pre-training via Semantic Rendering on LiDAR Point Clouds},
  author = {Hao Yang and Haiyang Wang and Di Dai and Liwei Wang},
  journal= {arXiv preprint arXiv:2311.04501},
  year   = {2023}
}