BEVFusion4D:基于跨模态引导与时间聚合的鸟瞰图下激光雷达-相机融合学习
计算机视觉与模式识别
2023-03-31 v1
摘要
将激光雷达与相机信息融合至鸟瞰图(BEV)已成为自动驾驶中3D目标检测的重要课题。现有方法大多采用独立的双分支框架生成激光雷达与相机BEV,再进行自适应模态融合。由于点云提供更精准的定位与几何信息,其可作为可靠的空间先验从图像中获取相关语义信息。因此,我们设计了激光雷达引导的视图变换器(LGVT),以有效获取BEV空间中的相机表征,从而裨益整个双分支融合系统。LGVT以相机BEV作为初始语义查询,反复利用激光雷达BEV的空间线索跨多个相机视角提取图像特征。此外,我们通过提出的时间可变形对齐(TDA)模块将框架扩展至时域,旨在聚合来自多个历史帧的BEV特征。包含这两个模块,我们的框架BEVFusion4D在3D目标检测上取得最先进结果,在nuScenes验证集上分别为72.0% mAP和73.5% NDS,在nuScenes测试集上分别为73.3% mAP和74.7% NDS。
引用
@article{arxiv.2303.17099,
title = {BEVFusion4D: Learning LiDAR-Camera Fusion Under Bird's-Eye-View via Cross-Modality Guidance and Temporal Aggregation},
author = {Hongxiang Cai and Zeyuan Zhang and Zhenyu Zhou and Ziyin Li and Wenbo Ding and Jiuhua Zhao},
journal= {arXiv preprint arXiv:2303.17099},
year = {2023}
}
备注
13 pages, 7 figures