从运动中学习运动恢复结构
计算机视觉与模式识别
2018-10-22 v2
摘要
本工作基于对深度神经网络从单幅图像预测深度的质量度量的质疑,进而对近期发表的从无监督视频学习深度的可用性提出质疑。为克服其局限性,我们提出以同样的无监督方式,从单目视频中学习一个以图像对作为输入的深度图推断系统。该算法实际上是从运动中学习运动恢复结构(structure-from-motion from motion),而不仅仅是从上下文外观中学习结构。尺度因子问题被显式处理,绝对深度图可由相机位移幅度估计,而位移幅度可容易地通过廉价外部传感器测量。我们的方案对于通过微调实现的域变化和适应也更加鲁棒,因为它不完全依赖上下文深度。考虑了两种用例:未稳定的运动相机视频与稳定的视频。这一选择受无人机(UAV,即 Unmanned Aerial Vehicle)用例的启发,其通常提供可靠的姿态测量。我们提供了一组实验,表明在仅能获知速度的实地条件下,我们的网络在大多数深度质量度量上优于竞争对手。结果在著名的 KITTI 数据集上给出,该数据集为我们的第二种用例提供了稳健的稳定化,但也包含非常典型的车内道路场景中的运动场景。随后我们在一个合成数据集上展示结果,认为其更能代表典型无人机场景。最后,我们展示了两个域适应用例,表明相较单视图深度算法,我们的方法具有更优的鲁棒性,说明其更适用于高度变化的视觉上下文。
引用
@article{arxiv.1809.04471,
title = {Learning structure-from-motion from motion},
author = {Clément Pinard and Laure Chevalley and Antoine Manzanera and David Filliat},
journal= {arXiv preprint arXiv:1809.04471},
year = {2018}
}