中文

所见即所得:利用可见性进行三维目标检测

计算机视觉与模式识别 2020-12-23 v3 机器人学

摘要

三维感知的最新进展给计算机视觉带来了独特的挑战。一个基本挑战是为三维传感器数据找到良好的表示。大多数流行的表示(如 PointNet)是在处理真正三维数据(例如从网格模型采样的点)的背景下提出的,忽略了诸如 LiDAR 扫描这样的三维传感数据实际上是 2.5D 的这一事实。我们认为,将 2.5D 数据表示为 (x, y, z) 点的集合从根本上破坏了关于自由空间的隐藏信息。在本文中,我们证明此类知识可通过三维光线投射高效恢复,并易于整合进基于批量的梯度学习中。我们描述了一种用可见性增强基于体素的网络的简单方法:我们添加一个体素化的可见性图作为额外的输入流。此外,我们表明可见性可与最先进三维检测器中两种关键的改进相结合:虚拟物体的合成数据增强以及多时间帧 LiDAR 扫描的时间聚合。在 NuScenes 三维检测基准上,我们表明,通过为可见性输入添加额外的流,我们可以显著提升最先进三维检测器的整体检测精度。

关键词

引用

@article{arxiv.1912.04986,
  title  = {What You See is What You Get: Exploiting Visibility for 3D Object Detection},
  author = {Peiyun Hu and Jason Ziglar and David Held and Deva Ramanan},
  journal= {arXiv preprint arXiv:1912.04986},
  year   = {2020}
}

备注

CVPR'20. More at https://www.cs.cmu.edu/~peiyunh/wysiwyg