中文

RCBEVDet++: 面向高精度雷达-相机融合3D感知网络

计算机视觉与模式识别 2024-09-10 v1

摘要

感知周围环境是自动驾驶中的基本任务。为了获得高度准确的感知结果,现代自动驾驶系统通常采用多模态传感器来收集全面的环境数据。在这些传感器中,雷达-相机多模态感知系统尤其受欢迎,因为其出色的感知能力和成本效益。然而,雷达和相机传感器之间的显著模态差异构成了信息融合的挑战。为此,本文提出了RCBEVDet,一个雷达-相机融合的3D目标检测框架。具体而言,RCBEVDet是在现有的基于相机的3D目标检测器基础上开发的,辅以专门设计的雷达特征提取器RadarBEVNet和交叉注意力多层融合(CAMF)模块。首先,RadarBEVNet使用双流雷达主干网络和Radar Cross Section感知的BEV编码器将稀疏雷达点编码为密集的鸟瞰视图(BEV)特征。其次,CAMF模块利用可变形注意力机制对齐雷达和相机BEV特征,并采用通道和空间融合层进行融合。为进一步增强RCBEVDet的能力,我们引入RCBEVDet++,该方法通过稀疏融合、支持查询式多视图相机感知模型,并适应更广泛的感知任务。在nuScenes数据集上进行大量实验表明,我们的方法能够无缝集成到现有的基于相机的3D感知模型中,并在各种感知任务中提升其性能。值得注意的是,在图像主干网络使用ViT-L时,RCBEVDet++在3D目标检测中实现了72.73个NDS和67.34个mAP,无需测试时数据增强或模型集成。

关键词

引用

@article{arxiv.2409.04979,
  title  = {RCBEVDet++: Toward High-accuracy Radar-Camera Fusion 3D Perception Network},
  author = {Zhiwei Lin and Zhe Liu and Yongtao Wang and Le Zhang and Ce Zhu},
  journal= {arXiv preprint arXiv:2409.04979},
  year   = {2024}
}

备注

The extended work of RCBEVDet (CVPR2024)