中文

基于单目视频深度与位姿无监督学习的3D分层细化与增强

计算机视觉与模式识别 2022-06-09 v2

摘要

深度与自运动估计对于自主机器人与自动驾驶的定位和导航至关重要。近期研究使得从未标注单目视频中学习逐像素深度与自运动成为可能。本文提出一种利用显式3D几何进行3D分层细化与增强的无监督训练框架。在该框架中,深度与位姿估计分层且相互耦合,逐层细化估计的位姿。提出中间视图图像,并通过用估计深度与粗位姿对图像中像素进行扭曲来合成。然后,可从新视图图像与相邻帧图像估计残差位姿变换以细化粗位姿。本文以可微方式实现迭代细化,使整个框架得以统一优化。同时,提出一种通过合成新视图图像来增强位姿估计的图像增强方法,其创造性地在3D空间增强位姿却得到一张新的增强2D图像。在KITTI上的实验表明,我们的深度估计达到了最先进性能,甚至超越近期利用其他辅助任务的方法。我们的视觉里程计优于所有近期无监督单目基于学习的方法,并取得了与基于几何的方法ORB-SLAM2(带后端优化)相竞争的性能。

关键词

引用

@article{arxiv.2112.03045,
  title  = {3D Hierarchical Refinement and Augmentation for Unsupervised Learning of Depth and Pose from Monocular Video},
  author = {Guangming Wang and Jiquan Zhong and Shijie Zhao and Wenhua Wu and Zhe Liu and Hesheng Wang},
  journal= {arXiv preprint arXiv:2112.03045},
  year   = {2022}
}

备注

10 pages, 7 figures, under review