利用三维几何约束从单目视频无监督学习深度与自运动
计算机视觉与模式识别
2018-06-12 v2
摘要
我们提出了一种从单目视频无监督学习深度与自运动的新方法。无监督学习消除了对单独监督信号(深度或自运动真值,或多视图视频)的需求。先前无监督深度学习的工作使用逐像素或基于梯度的损失,其仅考虑小局部邻域中的像素。我们的主要贡献是显式地考虑推断出的场景三维几何,强制跨连续帧估计的三维点云与自运动的一致性。这是一项具有挑战性的任务,并通过一种用于对齐三维结构的新型(近似)反向传播算法得以解决。我们将这种新型基于三维的损失与基于使用来自相邻帧的估计深度和自运动进行帧重建的光度质量的二维损失相结合。我们还引入有效性掩码以避免惩罚不存在有用信息的区域。我们在 KITTI 数据集和未校准手机摄像头捕获的视频数据集上测试了我们的算法。我们提出的方法在这两个数据集上持续改善了深度估计,并在深度和自运动方面均优于最先进水平。由于我们仅需要简单的视频,在大型且多样的数据集上学习深度和自运动成为可能。我们通过在未校准的低质量视频数据集上训练并在 KITTI 上评估来展示这一点,其排名位居在 KITTI 本身上训练的顶尖已有方法之列。
引用
@article{arxiv.1802.05522,
title = {Unsupervised Learning of Depth and Ego-Motion from Monocular Video Using 3D Geometric Constraints},
author = {Reza Mahjourian and Martin Wicke and Anelia Angelova},
journal= {arXiv preprint arXiv:1802.05522},
year = {2018}
}
备注
Upload CVPR camera-ready