中文

通过二维-三维神经标定实现激光雷达三维点云的自监督学习

计算机视觉与模式识别 2025-08-21 v5

摘要

本文介绍了一种新颖的自监督学习框架,用于增强自动驾驶场景中的三维感知能力。具体而言,我们的方法名为 NCLR,专注于二维-三维神经标定,这是一项新颖的代理任务,旨在估计对齐相机与激光雷达坐标系的刚性位姿。首先,我们提出可学习的变换对齐,以弥合图像与点云数据之间的领域鸿沟,将特征转换到统一的表示空间,以便进行有效的比较与匹配。其次,我们利用融合特征识别图像与点云之间的重叠区域。第三,我们建立密集的二维-三维对应关系以估计刚体位姿。该框架不仅学习从点到像素的细粒度匹配,还在整体层面实现了图像与点云的对齐,从而理解激光雷达到相机的外参。我们通过将预训练的主干网络应用于下游任务(如基于激光雷达的三维语义分割、目标检测和全景分割)来证明 NCLR 的有效性。在多个数据集上的综合实验表明,NCLR 优于现有的自监督方法。结果证实,来自不同模态的联合学习显著增强了网络的理解能力和所学表示的有效性。代码已公开于 https://github.com/Eaphan/NCLR。

关键词

引用

@article{arxiv.2401.12452,
  title  = {Self-supervised Learning of LiDAR 3D Point Clouds via 2D-3D Neural Calibration},
  author = {Yifan Zhang and Junhui Hou and Siyu Ren and Jinjian Wu and Yixuan Yuan and Guangming Shi},
  journal= {arXiv preprint arXiv:2401.12452},
  year   = {2025}
}

备注

Accepted to TPAMI2025