中文

神经网络如何感知单幅图像中的深度?

计算机视觉与模式识别 2019-05-20 v1 机器人学

摘要

深度神经网络在单幅图像深度估计方面取得了突破性进展。近期工作往往聚焦于深度图的精度,通常在 KITTI 视觉基准等公开测试集上的评估常作为文章的主要结果。尽管此类评估展示了神经网络估计深度的能力,却未揭示其实现方式。据我们所知,目前尚无分析这些网络所学内容的工作。本文中,我们采用 Godard 等人提出的 MonoDepth 网络,探究其在深度估计中利用了哪些视觉线索。我们发现,该网络会忽略已知障碍物的表观尺寸,而倾向于利用它们在图像中的垂直位置。利用垂直位置需要已知相机位姿;然而我们发现 MonoDepth 仅对相机俯仰和翻滚的变化进行部分校正,且这些会影响对障碍物深度的估计。我们进一步表明,MonoDepth 对图像垂直位置的利用使其能估计到任意障碍物的距离,即便这些障碍物未出现在训练集中,但这需要物体与地面接触点处存在强边缘。在未来的工作中,我们将探究这些观察是否也适用于其他单目深度估计神经网络。

关键词

引用

@article{arxiv.1905.07005,
  title  = {How do neural networks see depth in single images?},
  author = {Tom van Dijk and Guido C. H. E. de Croon},
  journal= {arXiv preprint arXiv:1905.07005},
  year   = {2019}
}

备注

Submitted