中文

学习深度引导卷积用于单目3D目标检测

计算机视觉与模式识别 2019-12-16 v2

摘要

在无LiDAR的情况下从单幅图像进行3D目标检测是一项具有挑战性的任务,因为缺乏准确的深度信息。传统的2D卷积不适用于该任务,因为它们无法捕获局部目标及其尺度信息,而这些信息对3D目标检测至关重要。为了更好地表示3D结构,现有方法通常将从2D图像估计的深度图转换为伪LiDAR表示,然后应用现有的基于3D点云的目标检测器。然而,它们的结果严重依赖于估计深度图的准确性,导致性能次优。在本文中,我们不使用伪LiDAR表示,而是通过提出一种新的局部卷积网络(LCN),称为深度引导的动态深度可分离空洞LCN(D4^4LCN),来改进基础的2D全卷积,其中滤波器及其感受野可以从基于图像的深度图中自动学习,使得不同图像的不同像素具有不同的滤波器。D4^4LCN克服了传统2D卷积的局限性,并缩小了图像表示与3D点云表示之间的差距。大量实验表明,D4^4LCN以较大优势优于现有工作。例如,在KITTI上,D4^4LCN相对于最先进方法的相对改进在中等设置下为9.1%。代码可在 https://github.com/dingmyu/D4LCN 获取。

关键词

引用

@article{arxiv.1912.04799,
  title  = {Learning Depth-Guided Convolutions for Monocular 3D Object Detection},
  author = {Mingyu Ding and Yuqi Huo and Hongwei Yi and Zhe Wang and Jianping Shi and Zhiwu Lu and Ping Luo},
  journal= {arXiv preprint arXiv:1912.04799},
  year   = {2019}
}

备注

12 pages, 8 figures, modify email and add code