EPMF:面向三维语义分割的高效感知感知多传感器融合
计算机视觉与模式识别
2024-09-10 v3
摘要
我们研究用于三维语义分割的多传感器融合,该任务对许多应用(如自动驾驶和机器人)的场景理解十分重要。然而,现有的基于融合的方法由于两种模态间的巨大差异可能无法取得令人满意的性能。在本工作中,我们研究一种称为感知感知多传感器融合(PMF)的协同融合方案,以有效利用来自两种模态的感知信息,即来自 RGB 图像的外观信息和来自点云的空间深度信息。为此,我们使用透视投影将点云投影到相机坐标系,并在二维空间中处理来自 LiDAR 和相机的两种输入,同时防止 RGB 图像的信息丢失。然后,我们提出一个双流网络分别提取两种模态的特征。提取的特征通过有效的基于残差的融合模块进行融合。此外,我们引入额外的感知感知损失来衡量两种模态之间的感知差异。最后,我们提出 PMF 的改进版本,即 EPMF,其通过在透视投影下优化数据预处理和网络架构而更加高效有效。具体而言,我们提出跨模态对齐与裁剪以获得紧凑输入并降低不必要的计算成本。随后我们在透视投影下探索更高效的上下文模块,并将 LiDAR 特征融合进相机流以提升双流网络的性能。在基准数据集上的大量实验显示了我们方法的优越性。例如,在 nuScenes 测试集上,我们的 EPMF 在 mIoU 上比最先进方法 RangeFormer 高出 0.9%。我们的源代码发布于 https://github.com/ICEORY/PMF。
引用
@article{arxiv.2106.15277,
title = {EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation},
author = {Mingkui Tan and Zhuangwei Zhuang and Sitao Chen and Rong Li and Kui Jia and Qicheng Wang and Yuanqing Li},
journal= {arXiv preprint arXiv:2106.15277},
year = {2024}
}
备注
16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper