中文

MV-JAR:基于 LiDAR 自监督预训练的掩码体素拼图与重建

计算机视觉与模式识别 2023-03-24 v1

摘要

本文介绍了用于基于 LiDAR 的自监督预训练的掩码体素拼图与重建(MV-JAR)方法,以及在 Waymo 数据集上精心设计的兼顾数据效率的三维目标检测基准。受下游三维目标检测器中场景-体素-点层级结构的启发,我们设计了考虑场景中体素分布及体素内局部点分布的掩码与重建策略。我们采用反向最远体素采样(Reversed-Furthest-Voxel-Sampling)策略来解决 LiDAR 点分布不均的问题,并提出 MV-JAR,其结合了两种对上述分布建模的技术,从而获得优越性能。我们的实验揭示了先前数据效率实验的局限性:其从每个 LiDAR 序列中按不同数据比例均匀采样微调划分,导致各划分间数据多样性相似。为此,我们提出一个新基准,通过采样场景序列来获得多样化的微调划分,确保模型充分收敛并提供对预训练方法更准确的评估。在我们的 Waymo 基准和 KITTI 数据集上的实验表明,MV-JAR 在各种数据规模下持续且显著地提升三维检测性能,相较于从头训练 mAPH 最高提升 6.3%。代码与基准将发布于 https://github.com/SmartBot-PJLab/MV-JAR。

关键词

引用

@article{arxiv.2303.13510,
  title  = {MV-JAR: Masked Voxel Jigsaw and Reconstruction for LiDAR-Based Self-Supervised Pre-Training},
  author = {Runsen Xu and Tai Wang and Wenwei Zhang and Runjian Chen and Jinkun Cao and Jiangmiao Pang and Dahua Lin},
  journal= {arXiv preprint arXiv:2303.13510},
  year   = {2023}
}

备注

Accepted by CVPR 2023 with a carefully designed benchmark on Waymo. Codes and the benchmark will be available at https://github.com/SmartBot-PJLab/MV-JAR