中文

利用合成数据从单目视频学习深度:一种时间一致的域自适应方法

计算机视觉与模式识别 2019-11-27 v2

摘要

大多数最先进的单目深度估计方法都是监督学习方法。这类方法的成功严重依赖于高质量的深度标签,而获取这些标签成本高昂。一些近期方法试图通过利用单目视频中更易获取但可靠性较低的无监督线索来学习深度网络。在本文中,我们提出通过从具有易获取真实深度标签的合成视频中迁移知识来解决这一困境。由于合成图像与真实图像之间存在风格差异,我们提出了一种时间一致的域自适应(TCDA)方法,该方法同时利用合成域中的标签和视频中的时间约束来改进风格迁移与深度预测。此外,我们利用合成数据中的真实光流和位姿信息来学习运动掩码与位姿预测网络。学到的运动掩码可以滤除产生错误时间约束的运动区域,而估计出的位姿为估计时间约束提供了更好的初始化。实验结果证明了我们方法的有效性,并与最先进方法性能相当。

关键词

引用

@article{arxiv.1907.06882,
  title  = {Learning Depth from Monocular Videos Using Synthetic Data: A Temporally-Consistent Domain Adaptation Approach},
  author = {Yipeng Mou and Mingming Gong and Huan Fu and Kayhan Batmanghelich and Kun Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:1907.06882},
  year   = {2019}
}