中文

面向三维目标检测的稠密体素融合

计算机视觉与模式识别 2022-10-28 v2

摘要

相机与激光雷达传感器模态为自动驾驶应用中的三维目标检测提供了互补的外观与几何信息。然而,当前的端到端融合方法训练困难,且性能不及最先进的纯激光雷达检测器。顺序融合方法因点云稀疏性而受限于有限的像素与点对应关系,或其性能严格受限于其中一种模态的检测结果。我们提出的解决方案——稠密体素融合(Dense Voxel Fusion, DVF)是一种顺序融合方法,可生成多尺度稠密体素特征表示,从而提升低点密度区域的表达能力。为增强多模态学习,我们直接使用投影的真值三维边界框标签进行训练,避免了噪声大且依赖特定检测器的二维预测。DVF 及该多模态训练方法均可应用于任何基于体素的激光雷达骨干网络。在 KITTI 三维车辆检测基准上,DVF 在已发表的融合方法中排名第三,且未引入额外的可训练参数,也不需要立体图像或稠密深度标签。此外,在 Waymo Open Dataset 上,DVF 显著提升了基于体素方法的三维车辆检测性能。

关键词

引用

@article{arxiv.2203.00871,
  title  = {Dense Voxel Fusion for 3D Object Detection},
  author = {Anas Mahmoud and Jordan S. K. Hu and Steven L. Waslander},
  journal= {arXiv preprint arXiv:2203.00871},
  year   = {2022}
}

备注

Accepted in WACV 2023