中文

弥合雷达与相机特征视角差异用于多模态融合三维目标检测

计算机视觉与模式识别 2022-11-01 v2

摘要

雷达与相机多模态融合的环境感知在自动驾驶中至关重要,以提升准确性、完整性与鲁棒性。本文聚焦于利用毫米波(MMW)雷达与相机传感器融合进行三维目标检测。提出一种在鸟瞰图(BEV)下实现特征级融合以获得更优特征表示的新方法。首先,雷达点经时间累积增强并送入时空编码器提取雷达特征。同时,通过图像骨干与颈模型获取适应多种空间尺度的多尺度图像二维特征。随后,图像特征经设计的视角变换器转换至BEV。此外,本工作以称为点融合与ROI融合的两阶段融合模型分别融合多模态特征。最后,检测头回归物体类别与三维位置。实验结果表明,所提方法在具挑战性的nuScenes数据集上于最关键检测指标——平均精度均值(mAP)与nuScenes检测分数(NDS)上实现了最先进(SOTA)性能。

关键词

引用

@article{arxiv.2208.12079,
  title  = {Bridging the View Disparity Between Radar and Camera Features for Multi-modal Fusion 3D Object Detection},
  author = {Taohua Zhou and Yining Shi and Junjie Chen and Kun Jiang and Mengmeng Yang and Diange Yang},
  journal= {arXiv preprint arXiv:2208.12079},
  year   = {2022}
}

备注

12 pages,6 figures