中文

LiDAR语义分割的多模态NeRF自监督学习

计算机视觉与模式识别 2024-11-06 v1 机器人学

摘要

LiDAR语义分割是自动驾驶感知中的基础任务,旨在将每个LiDAR点关联到语义标签。全监督模型已广泛处理该任务,但需要每个扫描的标注,这要么限制了其领域,要么需要大量昂贵的标注。与LiDAR点云一同记录的相机图像可由广泛可用的2D基础模型处理,这些模型具有通用性且不依赖数据集。然而,将2D数据中的知识蒸馏以提升LiDAR感知会引发域适应挑战。例如,经典的透视投影会因两个传感器在各自采集时刻的位置偏移而产生视差效应。我们提出了一种半监督学习设置,利用无标注LiDAR点云以及从相机图像中蒸馏的知识。为了在无标注扫描上自监督模型,我们添加了一个辅助NeRF头,并从相机视点对无标注体素特征投射光线。NeRF头预测每个采样光线位置的密度和语义对数几率,用于渲染像素语义。与此同时,我们使用Segment-Anything (SAM)基础模型结合相机图像生成一组无标注通用掩码。我们将这些掩码与来自LiDAR的渲染像素语义融合,生成用于监督像素预测的伪标签。在推理阶段,我们移除NeRF头,仅使用LiDAR运行模型。我们在三个公开LiDAR语义分割基准上验证了方法的有效性:nuScenes、SemanticKITTI和ScribbleKITTI。

关键词

引用

@article{arxiv.2411.02969,
  title  = {Multi-modal NeRF Self-Supervision for LiDAR Semantic Segmentation},
  author = {Xavier Timoneda and Markus Herb and Fabian Duerr and Daniel Goehring and Fisher Yu},
  journal= {arXiv preprint arXiv:2411.02969},
  year   = {2024}
}

备注

IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2024