中文

CRT-Fusion:利用运动信息实现相机、雷达与时间融合的三维目标检测

计算机视觉与模式识别 2024-12-12 v3

摘要

准确且鲁棒的三维目标检测是自动驾驶车辆和机器人技术中的关键组成部分。虽然最近的雷达-相机融合方法通过融合鸟瞰图(BEV)表示中的信息取得了显著进展,但它们往往难以有效捕捉动态物体的运动,导致在实际场景中的性能有限。在本文中,我们提出了CRT-Fusion,一种将时间信息集成到雷达-相机融合中的新型框架,以解决这一挑战。我们的方法包含三个关键模块:多视图融合(MVF)、运动特征估计器(MFE)和运动引导时间融合(MGTF)。MVF模块在相机视图和鸟瞰图中融合雷达和图像特征,从而生成更精确的统一BEV表示。MFE模块执行两个同时任务:像素级速度估计和BEV分割。基于MFE模块获得的速度和占用分数图,MGTF模块以递归方式在多个时间戳之间对齐和融合特征图。通过考虑动态物体的运动,CRT-Fusion能够生成鲁棒的BEV特征图,从而提高检测精度和鲁棒性。在具有挑战性的nuScenes数据集上的广泛评估表明,CRT-Fusion在雷达-相机三维目标检测方面达到了最先进的性能。我们的方法在NDS上优于之前最佳方法+1.7%,同时在mAP上超越了领先方法+1.4%。这两个指标的显著提升展示了所提出的融合策略在提高三维目标检测可靠性和准确性方面的有效性。

关键词

引用

@article{arxiv.2411.03013,
  title  = {CRT-Fusion: Camera, Radar, Temporal Fusion Using Motion Information for 3D Object Detection},
  author = {Jisong Kim and Minjae Seong and Jun Won Choi},
  journal= {arXiv preprint arXiv:2411.03013},
  year   = {2024}
}

备注

Accepted at NeurIPS2024