基于视频的无监督尺度一致深度学习
计算机视觉与模式识别
2021-11-29 v1
摘要
我们提出了一种单目深度估计器 SC-Depth,其仅需无标签视频进行训练,并能在推理时实现尺度一致的预测。我们的贡献包括:(i) 我们提出了一种几何一致性损失,用于惩罚相邻视图间预测深度的不一致性;(ii) 我们提出了一种自发现掩码,可自动定位违反底层静态场景假设并在训练期间产生噪声信号的移动物体;(iii) 我们通过详细的消融研究展示了各组件的有效性,并在 KITTI 和 NYUv2 数据集上展示了高质量的深度估计结果。此外,得益于尺度一致预测的能力,我们展示了我们的单目训练深度网络可轻松集成到 ORB-SLAM2 系统中,以实现更鲁棒和准确的跟踪。所提出的混合 Pseudo-RGBD SLAM 在 KITTI 中展现出引人注目的结果,并且无需额外训练即可很好地泛化到 KAIST 数据集。最后,我们提供了若干演示以进行定性评估。
引用
@article{arxiv.2105.11610,
title = {Unsupervised Scale-consistent Depth Learning from Video},
author = {Jia-Wang Bian and Huangying Zhan and Naiyan Wang and Zhichao Li and Le Zhang and Chunhua Shen and Ming-Ming Cheng and Ian Reid},
journal= {arXiv preprint arXiv:2105.11610},
year = {2021}
}
备注
Accept to IJCV. The source code is available at https://github.com/JiawangBian/SC-SfMLearner-Release