中文

基于自监督激光雷达场景流骨干网络的 3D 目标检测

计算机视觉与模式识别 2022-07-20 v2

摘要

最先进的基于激光雷达的 3D 目标检测方法依赖监督学习与大型标注数据集。然而,标注激光雷达数据耗费资源,且仅依赖监督学习限制了训练模型的适用性。自监督训练策略可通过为下游 3D 视觉任务学习通用点云骨干模型来缓解这些问题。在此背景下,我们展示了自监督多帧流表示与单帧 3D 检测假设之间的关系。我们的主要贡献利用学习到的流与运动表示,并将自监督骨干网络与有监督 3D 检测头相结合。首先,以循环一致性训练一个自监督场景流估计模型。然后,该模型的点云编码器被用作单帧 3D 目标检测头模型的骨干。这第二个 3D 目标检测模型学习利用运动表示来区分表现出不同运动模式的动态物体。在 KITTI 与 nuScenes 基准上的实验表明,所提出的自监督预训练显著提升了 3D 检测性能。https://github.com/emecercelik/ssl-3d-detection.git

关键词

引用

@article{arxiv.2205.00705,
  title  = {3D Object Detection with a Self-supervised Lidar Scene Flow Backbone},
  author = {Ekim Yurtsever and Emeç Erçelik and Mingyu Liu and Zhijie Yang and Hanzhen Zhang and Pınar Topçam and Maximilian Listl and Yılmaz Kaan Çaylı and Alois Knoll},
  journal= {arXiv preprint arXiv:2205.00705},
  year   = {2022}
}