中文

SparseFusion:融合多模态稀疏表示的多传感器三维目标检测

计算机视觉与模式识别 2023-04-28 v1

摘要

通过识别现有激光雷达-相机三维目标检测方法的四个重要组成部分(激光雷达与相机候选、变换和融合输出),我们观察到所有现有方法要么寻找稠密候选,要么生成场景的稠密表示。然而,鉴于物体仅占场景的一小部分,寻找稠密候选并生成稠密表示是含噪且低效的。我们提出 SparseFusion,一种专门使用稀疏候选和稀疏表示的新型多传感器三维检测方法。具体而言,SparseFusion 利用激光雷达和相机模态中并行检测器的输出作为融合的稀疏候选。我们通过解耦物体表示将相机候选变换到激光雷达坐标空间。然后,我们可以通过轻量级自注意力模块在统一的 3D 空间中融合多模态候选。为缓解模态间的负迁移,我们提出新颖的语义和几何跨模态迁移模块,应用于特定模态检测器之前。SparseFusion 在 nuScenes 基准上取得了最先进的性能,同时运行速度最快,甚至优于具有更强骨干网络的方法。我们进行了大量实验以证明我们各模块及整体方法流程的有效性和高效性。我们的代码将在 https://github.com/yichen928/SparseFusion 公开。

关键词

引用

@article{arxiv.2304.14340,
  title  = {SparseFusion: Fusing Multi-Modal Sparse Representations for Multi-Sensor 3D Object Detection},
  author = {Yichen Xie and Chenfeng Xu and Marie-Julie Rakotosaona and Patrick Rim and Federico Tombari and Kurt Keutzer and Masayoshi Tomizuka and Wei Zhan},
  journal= {arXiv preprint arXiv:2304.14340},
  year   = {2023}
}