中文

基于几何的单目视频下一帧预测

机器学习 2017-06-14 v2 计算机视觉与模式识别

摘要

我们考虑了从视频输入进行下一帧预测的问题。训练一个循环卷积神经网络从单目视频输入中预测深度,该深度与当前视频图像和相机轨迹一起,可用于计算下一帧。与先前的下一帧预测方法不同,我们利用场景几何,并使用预测的深度来生成下一帧预测。我们的方法可以产生丰富的下一帧预测,其中包含附加到每个像素的深度信息。我们方法的另一个新颖之处在于,它是从图像序列(例如视频中)而不是从单张静止图像预测深度。我们在 KITTI 数据集上评估了所提出的方法,该数据集是用于自动驾驶相关基准测试任务的标准数据集。所提出的方法在视觉和数值上均优于直接预测下一帧的现有方法。我们表明,深度预测的准确度随着考虑更多先前帧而提高。

关键词

引用

@article{arxiv.1609.06377,
  title  = {Geometry-Based Next Frame Prediction from Monocular Video},
  author = {Reza Mahjourian and Martin Wicke and Anelia Angelova},
  journal= {arXiv preprint arXiv:1609.06377},
  year   = {2017}
}

备注

To appear in 2017 IEEE Intelligent Vehicles Symposium