中文

MegaDepth:从互联网照片中学习单视图深度预测

计算机视觉与模式识别 2018-11-29 v4

摘要

单视图深度预测是计算机视觉中的一个基本问题。近来,深度学习方法取得了显著进展,但这类方法受限于可用的训练数据。当前基于3D传感器的数据集有关键局限,包括仅室内图像(NYU)、训练样本数量少(Make3D)以及稀疏采样(KITTI)。我们提出利用多视图互联网照片集合这一几乎无限的数据源,通过现代运动恢复结构和多视图立体(MVS)方法生成训练数据,并基于该思想提出一个名为 MegaDepth 的大型深度数据集。源自 MVS 的数据有其自身的挑战,包括噪声和不可重建物体。我们通过新的数据清洗方法以及利用语义分割自动生成序数深度关系来扩充数据,应对这些挑战。我们通过展示在 MegaDepth 上训练的模型表现出强泛化能力——不仅面向新场景,也面向其他多样数据集包括 Make3D、KITTI 和 DIW,即便训练时未见到这些数据集的任何图像——来验证大量互联网数据的使用。

关键词

引用

@article{arxiv.1804.00607,
  title  = {MegaDepth: Learning Single-View Depth Prediction from Internet Photos},
  author = {Zhengqi Li and Noah Snavely},
  journal= {arXiv preprint arXiv:1804.00607},
  year   = {2018}
}

备注

updated paper for 'MegaDepth: Learning Single-View Depth Prediction from Internet Photos', CVPR, 2018