通过分层预测学习生成长期未来
计算机视觉与模式识别
2018-01-09 v5
摘要
我们提出一种用于对未来帧进行长期预测的分层方法。为避免递归像素级预测中固有的复合误差,我们提议首先估计输入帧中的高层结构,然后预测该结构在未来的演化,最后通过观测过去的一帧和预测的高层结构,我们构建未来帧而无需观测任何像素级预测。长期视频预测通过递归观测预测帧难以执行,因为像素空间中的小误差随着预测向未来深入而指数级放大。我们的方法通过消除观测预测帧的需要,防止了像素级误差传播的发生。我们的模型由 LSTM 与基于类比的编码器-解码器卷积神经网络组合构建,它们分别独立地预测视频结构并生成未来帧。在实验中,我们的模型在 Human3.6M 和 Penn Action 数据集上针对人类执行动作的长期像素级视频预测任务进行了评估,并展现出显著优于当前最先进水平的结果。
引用
@article{arxiv.1704.05831,
title = {Learning to Generate Long-term Future via Hierarchical Prediction},
author = {Ruben Villegas and Jimei Yang and Yuliang Zou and Sungryull Sohn and Xunyu Lin and Honglak Lee},
journal= {arXiv preprint arXiv:1704.05831},
year = {2018}
}
备注
International Conference on Machine Learning (ICML) 2017