中文

从单目视频中学习无监督尺度一致的深度与自运动

计算机视觉与模式识别 2019-10-04 v2

摘要

近期的工作表明,基于 CNN 的深度和自运动估计器可以使用未标记的单目视频进行学习。然而,其性能受到未识别运动物体的限制,这些物体违反了几何图像重建中潜在的静态场景假设。更显著的是,由于缺乏适当的约束,网络在不同样本上输出尺度不一致的结果,即由于逐帧的尺度模糊性,自运动网络无法在长视频序列上提供完整的相机轨迹。本文通过提出用于尺度一致预测的几何一致性损失和处理运动物体及遮挡的诱导自发现掩码来解决这些挑战。由于我们不像近期的工作那样利用多任务学习,我们的框架更简单、更高效。综合评估结果表明,我们的深度估计器在 KITTI 数据集上取得了最先进的性能。此外,我们表明我们的自运动网络能够预测长视频序列的全局尺度一致的相机轨迹,并且由此产生的视觉里程计精度与近期使用立体视频训练的模型具有竞争力。据我们所知,这是第一项表明使用未标记单目视频训练的深度网络能够在长视频序列上预测全局尺度一致相机轨迹的工作。

关键词

引用

@article{arxiv.1908.10553,
  title  = {Unsupervised Scale-consistent Depth and Ego-motion Learning from Monocular Video},
  author = {Jia-Wang Bian and Zhichao Li and Naiyan Wang and Huangying Zhan and Chunhua Shen and Ming-Ming Cheng and Ian Reid},
  journal= {arXiv preprint arXiv:1908.10553},
  year   = {2019}
}

备注

Accepted to NeurIPS 2019. Code is available at https://github.com/JiawangBian/SC-SfMLearner-Release