CLOCs:用于三维目标检测的相机-激光雷达候选框融合
计算机视觉与模式识别
2020-09-03 v1
摘要
在基于激光雷达的三维目标检测与基于视频的二维目标检测的神经网络方面已取得显著进展。然而,训练网络以有效利用两种模态并展现出优于单模态网络的增益,却出奇地困难。本文提出一种新颖的相机-激光雷达候选框(CLOCs)融合网络。CLOCs融合提供了一种低复杂度的多模态融合框架,可显著提升单模态检测器的性能。CLOCs在任何二维与任何三维检测器的非极大值抑制(NMS)之前作用于组合输出的候选框,并被训练以利用它们的几何与语义一致性来产生更精确的最终三维与二维检测结果。我们在具有挑战性的KITTI目标检测基准(包括三维与鸟瞰图指标)上的实验评估显示出显著改进,尤其在远距离上优于基于融合的当前最优方法。在提交时,CLOCs在官方KITTI排行榜上位列所有基于融合的方法之首。录用后我们将发布代码。
引用
@article{arxiv.2009.00784,
title = {CLOCs: Camera-LiDAR Object Candidates Fusion for 3D Object Detection},
author = {Su Pang and Daniel Morris and Hayder Radha},
journal= {arXiv preprint arXiv:2009.00784},
year = {2020}
}