基于网络立体视频监督的动态场景深度预测
计算机视觉与模式识别
2019-04-26 v1
摘要
我们提出了一种完全数据驱动的方法,从包含大量非刚性物体(例如人)的多样化单目视频序列中计算深度。为了学习非刚性场景的重建线索,我们引入了一个由野外采集的立体视频组成的新数据集。该数据集具有广泛的场景类型,并包含大量非刚性物体,尤其是人。由此,我们计算视差图作为监督信号来训练我们的方法。我们提出了一种损失函数,使得即使在数据集中相机内参和立体基线未知的情况下也能生成深度预测。我们通过在具有深度监督的现有视频数据集(包括 SINTEL 和 KITTI)上评估我们的方法,验证了使用大量互联网视频的有效性,并表明我们的方法对自然场景具有更好的泛化能力。
引用
@article{arxiv.1904.11112,
title = {Web Stereo Video Supervision for Depth Prediction from Dynamic Scenes},
author = {Chaoyang Wang and Simon Lucey and Federico Perazzi and Oliver Wang},
journal= {arXiv preprint arXiv:1904.11112},
year = {2019}
}