中文

BEVDilation:面向3D目标检测的LiDAR中心多模态融合

计算机视觉与模式识别 2025-12-03 v1 机器人学

摘要

在鸟瞰图(BEV)表示中融合LiDAR和相机信息已证明其在3D目标检测中的有效性。然而,由于这些传感器在几何精度上的根本差异,先前方法中的无差别融合往往导致性能下降。在本文中,我们提出BEVDilation,一种以LiDAR为中心的新框架,在融合中优先考虑LiDAR信息。通过将图像BEV特征构建为隐式引导而非简单的拼接,我们的策略有效缓解了由图像深度估计误差引起的空间错位。此外,图像引导可以有效帮助LiDAR中心范式应对点云的稀疏性和语义限制。具体而言,我们提出稀疏体素膨胀块,通过图像先验来稠化前景体素以缓解固有的点稀疏性。此外,我们引入语义引导BEV膨胀块,通过图像语义引导和长程上下文捕获来增强LiDAR特征扩散处理。在具有挑战性的nuScenes基准上,BEVDilation在保持具有竞争力的计算效率的同时取得了优于最先进方法的性能。重要的是,我们的LiDAR中心策略相比朴素融合对深度噪声表现出更强的鲁棒性。源代码可在 https://github.com/gwenzhang/BEVDilation 获取。

关键词

引用

@article{arxiv.2512.02972,
  title  = {BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection},
  author = {Guowen Zhang and Chenhang He and Liyi Chen and Lei Zhang},
  journal= {arXiv preprint arXiv:2512.02972},
  year   = {2025}
}

备注

Accept by AAAI26