中文

DepthFusion:基于深度编码的LiDAR-摄像机3D目标检测混合特征融合

计算机视觉与模式识别 2025-05-13 v1

摘要

当前先进的LiDAR-摄像机3D目标检测器通常聚焦于特征融合,但忽略了深度因素在设计融合策略时的作用。在本工作中,我们首次发现不同模态在深度变化时发挥不同作用,通过统计分析和可视化方法。基于此发现,我们提出Depth-Aware Hybrid Feature Fusion(DepthFusion)策略,通过在全局和局部层面引入深度编码来指导点云和RGB图像模态权重。具体而言,Depth-GFusion模块通过深度编码自适应调整多模态全局特征中图像鸟瞰视角(BEV)特征的权重。此外,为弥补将原始特征转换为BEV空间时丢失的信息,提出Depth-LFusion模块,通过深度编码自适应调整多模态局部特征中原始体素特征和多视角图像特征的权重。在nuScenes和KITTI数据集上进行大量实验表明,我们的DepthFusion方法优于先前最先进的方法。此外,我们的DepthFusion在nuScenes-C数据集上对各种腐败情况更具鲁棒性,表现优于先前方法。

关键词

引用

@article{arxiv.2505.07398,
  title  = {DepthFusion: Depth-Aware Hybrid Feature Fusion for LiDAR-Camera 3D Object Detection},
  author = {Mingqian Ji and Jian Yang and Shanshan Zhang},
  journal= {arXiv preprint arXiv:2505.07398},
  year   = {2025}
}