基于立体RGB与深层LIDAR的网络用于三维目标检测
计算机视觉与模式识别
2021-03-26 v1
摘要
三维目标检测已成为自动驾驶场景中的新兴任务。先前工作使用基于投影或基于体素的模型处理三维点云。然而,两种方法均存在缺陷。基于体素的方法缺乏语义信息,而基于投影的方法在投影到不同视图时遭受大量空间信息损失。本文中,我们提出立体RGB与深层LIDAR(SRDL)框架,其可同时利用语义与空间信息,从而自然提升网络用于三维目标检测的性能。具体而言,网络从立体图像对生成候选框,并使用深度融合方案结合不同区域级特征。相较于先前工作,立体策略为预测提供了更多信息。随后,分割模块中堆叠若干局部与全局特征提取器,以从点云捕获更丰富的深层语义几何特征。在将内部点与融合特征对齐后,所提网络以更精确的方式细化预测,并以一种新颖紧凑方法编码整个边界框。在具挑战性的KITTI检测基准上的良好实验结果证明了利用立体图像与点云进行三维目标检测的有效性。
引用
@article{arxiv.2006.05187,
title = {Stereo RGB and Deeper LIDAR Based Network for 3D Object Detection},
author = {Qingdong He and Zhengning Wang and Hao Zeng and Yijun Liu and Shuaicheng Liu and Bing Zeng},
journal= {arXiv preprint arXiv:2006.05187},
year = {2021}
}