单目视频中的几何约束自监督学习:连接光流、深度与相机
计算机视觉与模式识别
2019-09-10 v2
摘要
我们提出了 GLNet,一个从单目视频中学习深度、光流、相机位姿和内参的自监督框架——旨在解决此类任务中获取真实 ground-truth 的困难。我们提出了三项贡献:1) 我们设计了新的损失函数,以捕获多重几何约束(如对极几何)以及支持多个运动物体(刚性与非刚性)的自适应光度损失;2) 我们扩展了模型,使其能够预测相机内参,从而适用于未标定视频;3) 我们提出了几种在线优化策略,这些策略依赖于我们自监督损失在训练和测试中的对称性,特别是优化模型参数和/或不同任务的输出,从而利用它们之间的相互作用。在所有几何和光度约束下联合优化系统输出的思想,可以看作是经典束调整的稠密推广。我们在 KITTI 和 Cityscapes 上证明了我们方法的有效性,在多个任务上优于先前的自监督方法。我们还展示了在 YouTube 视频中迁移学习的良好泛化能力。
引用
@article{arxiv.1907.05820,
title = {Self-supervised Learning with Geometric Constraints in Monocular Video: Connecting Flow, Depth, and Camera},
author = {Yuhua Chen and Cordelia Schmid and Cristian Sminchisescu},
journal= {arXiv preprint arXiv:1907.05820},
year = {2019}
}
备注
ICCV'19 camera ready