中文

基于可微束调整的自监督深度与自运动学习

计算机视觉与模式识别 2019-10-01 v1

摘要

仅从RGB输入预测场景深度与相机运动是一项具有挑战性的任务。大多数现有的基于学习的方法以有监督方式处理该任务,需要昂贵获取的 ground-truth 数据。更近的方法探索了在自监督学习框架中估计场景深度与相机位姿的可能性。尽管取得了令人鼓舞的结果,当前方法要么从单目视频学习深度与位姿,且通常未对场景结构与相机运动之间施加多视图几何约束,要么需要立体序列作为输入且帧间运动参数 ground-truth 须已知。本文中,我们提出通过融入可微束调整(BA)层、最小化特征度量误差来联合优化场景深度与相机运动,进而以视图合成形成光度一致性损失作为最终监督信号。所提方法仅需无标签单目视频作为输入,在KITTI与Cityscapes数据集上的大量实验表明,我们的方法在使用单目视频作为输入的自监督方法中达到state-of-the-art结果,甚至优于从标定立体序列学习(即带位姿监督)的一类方法。

关键词

引用

@article{arxiv.1909.13163,
  title  = {Self-Supervised Learning of Depth and Ego-motion with Differentiable Bundle Adjustment},
  author = {Yunxiao Shi and Jing Zhu and Yi Fang and Kuochin Lien and Junli Gu},
  journal= {arXiv preprint arXiv:1909.13163},
  year   = {2019}
}