中文

BEVFusion:基于统一鸟瞰图表示的多任务多传感器融合

计算机视觉与模式识别 2024-09-04 v3

摘要

多传感器融合对于准确可靠的自动驾驶系统至关重要。近期方法基于点级融合:用相机特征增强LiDAR点云。然而,相机到LiDAR的投影丢弃了相机特征的语义密度,阻碍了此类方法的有效性,尤其是对语义导向的任务(如3D场景分割)。在本文中,我们用BEVFusion打破了这一根深蒂固的惯例,这是一个高效且通用的多任务多传感器融合框架。它在共享的鸟瞰图(BEV)表示空间中统一多模态特征,很好地保留了几何与语义信息。为此,我们通过优化的BEV池化诊断并消除了视图变换中的关键效率瓶颈,将延迟降低了超过40倍。BEVFusion从根本上与任务无关,几乎无需架构改动即可无缝支持不同的3D感知任务。它在nuScenes上确立了新的最先进水平,在3D目标检测上实现了高1.3%的mAP和NDS,在BEV地图分割上实现了高13.6%的mIoU,且计算成本降低1.9倍。复现我们结果的代码见https://github.com/mit-han-lab/bevfusion。

关键词

引用

@article{arxiv.2205.13542,
  title  = {BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View Representation},
  author = {Zhijian Liu and Haotian Tang and Alexander Amini and Xinyu Yang and Huizi Mao and Daniela Rus and Song Han},
  journal= {arXiv preprint arXiv:2205.13542},
  year   = {2024}
}

备注

ICRA 2023. The first two authors contributed equally to this work. Project page: https://bevfusion.mit.edu