利用单目线索与速度引导构建自监督多帧深度学习方法
计算机视觉与模式识别
2022-08-22 v1
摘要
自监督单目方法能够高效学习弱纹理表面或反射物体的深度信息。然而,由于单目几何建模固有的模糊性,深度精度受到限制。相比之下,多帧深度估计方法借助多视图立体(MVS)的成功提升了深度精度,其直接利用了几何约束。遗憾的是,MVS 常受纹理缺失区域、非朗伯表面和移动物体的影响,尤其是在无已知相机运动和深度监督的真实世界视频序列中。因此,我们提出 MOVEDepth,其利用单目线索(MOnocular cues)与速度引导(VElocity guidance)来改进多帧深度(Depth)学习。不同于现有强制 MVS 深度与单目深度一致的方法,MOVEDepth 通过直接解决 MVS 的固有问题来提升多帧深度学习。我们方法的关键在于将单目深度作为几何先验来构建 MVS 代价体,并在预测相机速度引导下调整代价体的深度候选。我们进一步通过学习代价体中的不确定性来融合单目深度与 MVS 深度,从而实现对多视图几何模糊性的鲁棒深度估计。大量实验表明 MOVEDepth 达到了最先进(state-of-the-art)性能:在 KITTI 基准上,与 Monodepth2 和 PackNet 相比,我们的方法将深度精度相对提升了 20% 和 19.8%。MOVEDepth 也泛化到更具挑战性的 DDAD 基准,相对优于 ManyDepth 达 7.2%。代码见 https://github.com/JeffWang987/MOVEDepth。
引用
@article{arxiv.2208.09170,
title = {Crafting Monocular Cues and Velocity Guidance for Self-Supervised Multi-Frame Depth Learning},
author = {Xiaofeng Wang and Zheng Zhu and Guan Huang and Xu Chi and Yun Ye and Ziwei Chen and Xingang Wang},
journal= {arXiv preprint arXiv:2208.09170},
year = {2022}
}
备注
code: https://github.com/JeffWang987/MOVEDepth