中文

MSeg3D:面向自动驾驶的多模态三维语义分割

计算机视觉与模式识别 2023-03-16 v1

摘要

在自动驾驶中,LiDAR和相机是可用于三维语义分割的两种模态。流行的纯LiDAR方法由于激光点不足,在小物体和远处物体上的分割效果严重不佳,而鲁棒的多模态方案尚未得到充分探索,我们研究了其中三个关键固有难题:模态异质性、有限的传感器视场交集以及多模态数据增强。我们提出了一种多模态三维语义分割模型(MSeg3D),通过联合模态内特征提取与模态间特征融合来缓解模态异质性。MSeg3D中的多模态融合包含基于几何的特征融合GF-Phase、跨模态特征补全以及在所有可见点上的基于语义的特征融合SF-Phase。多模态数据增强通过对LiDAR点云和多相机图像分别施加非对称变换而重新焕发活力,这有助于模型在多样化增强变换下训练。MSeg3D在nuScenes、Waymo和SemanticKITTI数据集上取得了最先进的(state-of-the-art)结果。在多相机输入故障和多帧点云输入下,MSeg3D仍表现出鲁棒性并改进了纯LiDAR基线。我们的代码公开于\url{https://github.com/jialeli1/lidarseg3d}。

关键词

引用

@article{arxiv.2303.08600,
  title  = {MSeg3D: Multi-modal 3D Semantic Segmentation for Autonomous Driving},
  author = {Jiale Li and Hang Dai and Hao Han and Yong Ding},
  journal= {arXiv preprint arXiv:2303.08600},
  year   = {2023}
}

备注

Accepted to CVPR 2023 (preprint)