中文

CLFT:用于自动驾驶语义分割的相机-激光雷达融合 Transformer

计算机视觉与模式识别 2024-09-10 v3 机器人学

摘要

关于基于相机和 LiDAR 的自动驾驶语义物体分割的关键研究显著受益于深度学习的近期发展。具体而言,Vision Transformer 是一项新颖的突破,它成功地将多头注意力机制引入计算机视觉应用。因此,我们提出了一种基于 Vision Transformer 的网络,以执行用于自动驾驶的相机-LiDAR 融合语义分割。我们的提议在双向网络上使用了 Vision Transformer 的新型渐进组装策略,随后在 Transformer 解码器层中以交叉融合策略整合结果。与文献中的其他工作不同,我们的相机-LiDAR 融合 Transformer 在雨天和低照度等挑战性条件下进行了评估,表现出稳健的性能。本文报告了在不同模态下对车辆和人类类别的分割结果:仅相机、仅 LiDAR 以及相机-LiDAR 融合。我们对 CLFT 与其他同样用于语义分割的网络进行了连贯的受控基准实验。这些实验旨在从多模态传感器融合和骨干架构两个视角独立评估 CLFT 的性能。定量评估表明,与基于全卷积神经网络(FCN)的相机-LiDAR 融合神经网络相比,我们的 CLFT 网络在具有挑战性的暗湿条件下性能提升高达 10%。与使用 Transformer 骨干但采用单模态输入的网络相比,整体提升为 5-10%。

关键词

引用

@article{arxiv.2404.17793,
  title  = {CLFT: Camera-LiDAR Fusion Transformer for Semantic Segmentation in Autonomous Driving},
  author = {Junyi Gu and Mauro Bellone and Tomáš Pivoňka and Raivo Sell},
  journal= {arXiv preprint arXiv:2404.17793},
  year   = {2024}
}

备注

Accepted to IEEE Transactions on Intelligent Vehicles