MVLidarNet:基于多视图的自动驾驶实时多类场景理解
计算机视觉与模式识别
2020-08-19 v2 机器人学
摘要
自动驾驶需要推断可操作信息,例如检测和分类物体,以及确定可行驶空间。为此,我们提出多视图 LidarNet(MVLidarNet),一种两阶段深度神经网络,利用单帧 LiDAR 点云的多视图进行多类物体检测与可行驶空间分割。第一阶段处理投影到透视视图的点云以对场景进行语义分割。第二阶段随后处理(连同第一阶段的语义标签)投影到鸟瞰视图的点云,以检测和分类物体。两个阶段均使用编码器-解码器架构。我们展示了我们的多视图、多阶段、多类方法能够在具有同时超过一百辆车和行人的挑战性场景中,使用单帧 LiDAR 扫描作为输入来检测和分类物体,同时确定可行驶空间。该系统在专为自动驾驶汽车设计的嵌入式 GPU 上以 150 fps 高效运行,包括用于随时间保持身份的后处理步骤。我们在 KITTI 和一个更大的内部数据集上展示了结果,从而证明了该方法按数量级扩展的能力。
引用
@article{arxiv.2006.05518,
title = {MVLidarNet: Real-Time Multi-Class Scene Understanding for Autonomous Driving Using Multiple Views},
author = {Ke Chen and Ryan Oldja and Nikolai Smolyanskiy and Stan Birchfield and Alexander Popov and David Wehr and Ibrahim Eden and Joachim Pehserl},
journal= {arXiv preprint arXiv:2006.05518},
year = {2020}
}
备注
IROS 2020 conference (submitted March 1st, 2020). For accompanying video, see https://youtu.be/2ck5_sToayc