FusionPainting:基于自适应注意力的多模态融合用于 3D 目标检测
计算机视觉与模式识别
2021-08-11 v2
摘要
在 3D 中准确检测障碍物是自动驾驶和智能交通的一项基本任务。在这项工作中,我们提出了一个通用的多模态融合框架 FusionPainting,在语义层面上融合 2D RGB 图像和 3D 点云,以提升 3D 目标检测任务。特别地,FusionPainting 框架由三个主要模块组成:多模态语义分割模块、基于自适应注意力的语义融合模块和 3D 目标检测器。首先,基于 2D 和 3D 分割方法获得 2D 图像和 3D 激光雷达点云的语义信息。然后,基于所提出的基于注意力的语义融合模块对不同传感器的分割结果进行自适应融合。最后,涂有融合语义标签的点云被送入 3D 检测器以获得 3D 障碍物结果。所提框架的有效性已通过在大规模 nuScenes 检测基准上与三种不同基线进行比较得到验证。实验结果表明,与使用仅点云的方法以及仅用 2D 分割信息涂色的点云方法相比,该融合策略能显著提升检测性能。此外,所提方法在 nuScenes 测试基准上优于其他最先进的方法。
引用
@article{arxiv.2106.12449,
title = {FusionPainting: Multimodal Fusion with Adaptive Attention for 3D Object Detection},
author = {Shaoqing Xu and Dingfu Zhou and Jin Fang and Junbo Yin and Zhou Bin and Liangjun Zhang},
journal= {arXiv preprint arXiv:2106.12449},
year = {2021}
}
备注
Accepted by ITSC 2021