中文

用于无监督室内深度估计的自动校正网络

计算机视觉与模式识别 2021-12-15 v2

摘要

利用从未经标注视频训练的CNN进行单视图深度估计已显示出显著前景。然而,优异的结果大多在街景驾驶场景中取得,此类方法在其他设置中往往失效,尤其是手持设备拍摄的室内视频。本工作中,我们确认手持设置中表现出的复杂自运动是学习深度的关键障碍。我们的基础分析表明,旋转在训练中表现为噪声,而平移(基线)提供监督信号。为应对该挑战,我们提出一种数据预处理方法,通过消除训练图像的相对旋转来进行校正以实现有效学习。性能的显著提升验证了我们动机的正确性。为实现端到端学习而无需预处理,我们提出带有新颖损失函数的自动校正网络,其可在训练中自动学习校正图像。因此,在具有挑战性的NYUv2数据集上,我们的结果大幅优于先前无监督SOTA方法。我们还展示了训练模型在ScanNet和Make3D上的泛化能力,以及我们所提学习方法在7-Scenes和KITTI数据集上的通用性。

关键词

引用

@article{arxiv.2006.02708,
  title  = {Auto-Rectify Network for Unsupervised Indoor Depth Estimation},
  author = {Jia-Wang Bian and Huangying Zhan and Naiyan Wang and Tat-Jun Chin and Chunhua Shen and Ian Reid},
  journal= {arXiv preprint arXiv:2006.02708},
  year   = {2021}
}

备注

Accepted to TPAMI. Find code at https://github.com/JiawangBian