中文

重新审视真实世界自动驾驶中的多模态三维语义分割

计算机视觉与模式识别 2023-10-16 v1

摘要

激光雷达与相机是多模态三维语义分割的两类关键传感器,理应被高效且鲁棒地融合以保障各类真实场景下的安全。然而,现有多模态方法面临两大挑战:1)难以高效部署与实时执行;2)激光雷达与相机间弱标定下性能急剧退化。为应对这些挑战,我们提出CPGNet-LCF,一种扩展自纯激光雷达CPGNet的新型多模态融合框架。CPGNet-LCF通过继承CPGNet易部署与实时的特性解决第一重挑战。针对第二重挑战,我们在训练时引入一种新颖的弱标定知识蒸馏策略以提升对弱标定的鲁棒性。CPGNet-LCF在nuScenes与SemanticKITTI基准上取得最先进性能。值得注意的是,它可轻松部署,在单块Tesla V100 GPU上以TensorRT TF16模式每帧运行20毫秒。此外,我们在四种弱标定等级上基准测试了性能,证明了所提方法的鲁棒性。

关键词

引用

@article{arxiv.2310.08826,
  title  = {Revisiting Multi-modal 3D Semantic Segmentation in Real-world Autonomous Driving},
  author = {Feng Jiang and Chaoping Tu and Gang Zhang and Jun Li and Hanqing Huang and Junyu Lin and Di Feng and Jian Pu},
  journal= {arXiv preprint arXiv:2310.08826},
  year   = {2023}
}

备注

7 pages, 3 figures