每像素皆重要:基于整体三维运动理解的无监督几何学习
计算机视觉与模式识别
2018-08-17 v2
摘要
通过深度卷积网络观看无标签视频来估计单幅图像中的三维几何,近来已取得显著进展。当前最先进(SOTA)方法基于刚体运动恢复结构的学习框架,其中仅对三维相机自运动建模以估计几何。然而,许多视频中亦存在运动物体,例如街景中行驶的汽车。本文通过将逐像素三维物体运动额外引入学习框架来处理此类运动,从而提供整体三维场景流理解并助力单图像几何估计。具体而言,给定视频中两连续帧,我们采用运动网络预测其相对三维相机位姿,以及区分运动物体与刚体背景的分割掩码。光流网络用于估计稠密二维逐像素对应。单图像深度网络预测两帧的深度图。四类信息,即二维流、相机位姿、分割掩码与深度图,被集成入可微的整体三维运动解析器(HMP),其中刚体背景与运动物体的逐像素三维运动得以恢复。我们针对两类三维运动设计多种损失以训练深度与运动网络,进一步降低估计几何的误差。最后,为解决单目视频中的三维运动混淆,我们将立体图像结合进联合训练。在 KITTI 2015 数据集上的实验表明,我们所估计的几何、三维运动与运动物体掩码不仅被约束为一致,且显著优于其他 SOTA 算法,证明了该方法之益。
引用
@article{arxiv.1806.10556,
title = {Every Pixel Counts: Unsupervised Geometry Learning with Holistic 3D Motion Understanding},
author = {Zhenheng Yang and Peng Wang and Yang Wang and Wei Xu and Ram Nevatia},
journal= {arXiv preprint arXiv:1806.10556},
year = {2018}
}
备注
ECCV18' submission