中文

VoxelNet:基于点云的 3D 目标检测的端到端学习

计算机视觉与模式识别 2017-11-20 v1

摘要

在 3D 点云中准确检测物体是许多应用中的核心问题,例如自主导航、家用机器人和增强/虚拟现实。为了将高度稀疏的 LiDAR 点云与区域提议网络(RPN)对接,现有多数工作集中于手工设计的特征表示,例如鸟瞰图投影。在本工作中,我们去除对 3D 点云人工特征工程的需求,提出 VoxelNet,一种通用的 3D 检测网络,将特征提取与边界框预测统一为单阶段、端到端可训练的深层网络。具体而言,VoxelNet 将点云划分为等间距的 3D 体素,并通过新引入的体素特征编码(VFE)层将每个体素内的一组点转换为统一的特征表示。以此方式,点云被编码为描述性的体素化表示,随后接入 RPN 以生成检测结果。在 KITTI 汽车检测基准上的实验表明,VoxelNet 大幅优于基于 LiDAR 的当前最优(SOTA)3D 检测方法。此外,我们的网络学习到具有不同几何形状物体的有效判别性表示,仅基于 LiDAR 即在行人与骑行者的 3D 检测中取得令人鼓舞的结果。

关键词

引用

@article{arxiv.1711.06396,
  title  = {VoxelNet: End-to-End Learning for Point Cloud Based 3D Object Detection},
  author = {Yin Zhou and Oncel Tuzel},
  journal= {arXiv preprint arXiv:1711.06396},
  year   = {2017}
}