中文

融合传统立体视觉知识的学习单目深度估计

计算机视觉与模式识别 2019-04-09 v1

摘要

从单幅图像估计深度是一项引人入胜却极具挑战的问题,有着无数应用。近期工作证明,该任务可借助序列或立体图像对上的图像合成,无需来自真实标签的直接监督即可学习。聚焦于后一种情况,本文利用立体匹配来改进单目深度估计。为此,我们提出monoResMatch,一种新颖的深度架构,旨在通过从与输入图像水平对齐的不同视点合成特征,并在两种线索间执行立体匹配,从单张输入图像推断深度。与先前共享此思路的工作不同,我们的网络是首个从头端到端训练的。此外,我们展示了通过传统立体算法(如半全局匹配)获取代理真实标注,能够在保持自监督方法、避免昂贵深度标签需求的同时,实现更精确的单目深度估计。详尽的实验结果证明,所提monoResMatch架构与代理监督之间的协同作用达到了自监督单目深度估计的state-of-the-art。代码已公开于https://github.com/fabiotosi92/monoResMatch-Tensorflow。

关键词

引用

@article{arxiv.1904.04144,
  title  = {Learning monocular depth estimation infusing traditional stereo knowledge},
  author = {Fabio Tosi and Filippo Aleotti and Matteo Poggi and Stefano Mattoccia},
  journal= {arXiv preprint arXiv:1904.04144},
  year   = {2019}
}

备注

accepted at CVPR 2019. Code available at https://github.com/fabiotosi92/monoResMatch-Tensorflow