中文

用于半监督单目深度估计的大规模 RGB-D 数据集

计算机视觉与模式识别 2021-10-25 v2

摘要

当前用于单目深度估计的自监督方法主要基于深度嵌套的卷积网络,在训练阶段利用立体图像对或单目序列。然而,它们往往在遮挡区域和深度边界附近表现出不准确的结果。本文提出一种简单而有效的利用立体图像对进行单目深度估计的方法。该研究旨在提出一种师生策略,其中浅层学生网络利用从更深且更准确的教师网络获得的辅助信息进行训练。具体而言,我们首先通过充分利用三维几何的双眼感知来训练立体教师网络,然后利用教师网络的深度预测来训练学生网络以进行单目深度推断。这使我们能够利用来自海量无标签立体图像对的所有可用深度数据。我们提出一种策略,涉及使用数据集成来合并教师网络的多个深度预测,从而通过收集超越单一预测的非平凡知识来改进训练样本。为了细化训练学生网络时所使用的不准确深度估计,我们进一步提出立体置信度引导的回归损失,以处理遮挡、无纹理区域和重复模式中的不可靠伪深度值。为了补充现有包含室外驾驶场景的数据集,我们构建了一个新颖的大规模数据集,包含使用手持立体相机拍摄的一百万张室外立体图像。最后,我们证明该单目深度估计网络提供的特征表示适用于高层视觉任务。针对各种室外场景的实验结果证明了我们方法的有效性和灵活性,其性能优于当前最先进的方法。

关键词

引用

@article{arxiv.1904.10230,
  title  = {A Large RGB-D Dataset for Semi-supervised Monocular Depth Estimation},
  author = {Jaehoon Cho and Dongbo Min and Youngjung Kim and Kwanghoon Sohn},
  journal= {arXiv preprint arXiv:1904.10230},
  year   = {2021}
}

备注

https://dimlrgbd.github.io/