中文

Every Pixel Counts++:基于三维整体理解的几何与运动联合学习

计算机视觉与模式识别 2019-07-12 v2

摘要

近年来,通过深度卷积网络观看无标签视频来估计单帧中的三维几何以及连续帧间的光流,已取得了显著进展。当前最先进(SoTA)的方法将两个任务独立处理。现有深度估计方法的典型假设之一是场景不包含独立运动的物体,而物体运动可轻易用光流建模。本文中,我们提出将两个任务作为一个整体来处理,即联合理解逐像素的三维几何与运动。这消除了对静态场景假设的需求,并在学习过程中强化了固有的几何一致性,从而显著改善了两个任务的结果。我们将该方法称为“Every Pixel Counts++”或“EPC++”。具体而言,在训练时,给定视频中的连续两帧,我们采用三个并行网络分别预测相机运动(MotionNet)、稠密深度图(DepthNet)和两帧间的逐像素光流(OptFlowNet)。这三类信息被输入一个整体三维运动解析器(HMP),刚体背景与运动物体的逐像素三维运动被解耦并恢复。我们在不同场景的数据集上进行了综合实验,包括驾驶场景(KITTI 2012 和 KITTI 2015 数据集)、混合室外/室内场景(Make3D)以及合成动画(MPI Sintel 数据集)。在深度估计、光流估计、里程计、运动物体分割和场景流估计这五项任务上的性能表明,我们的方法优于其他 SoTA 方法。代码将发布于:https://github.com/chenxuluo/EPC。

关键词

引用

@article{arxiv.1810.06125,
  title  = {Every Pixel Counts ++: Joint Learning of Geometry and Motion with 3D Holistic Understanding},
  author = {Chenxu Luo and Zhenheng Yang and Peng Wang and Yang Wang and Wei Xu and Ram Nevatia and Alan Yuille},
  journal= {arXiv preprint arXiv:1810.06125},
  year   = {2019}
}

备注

Chenxu Luo, Zhenheng Yang, and Peng Wang contributed equally, TPAMI submission