用于未来视频预测的折叠循环神经网络
计算机视觉与模式识别
2018-03-19 v2 机器学习
摘要
未来视频预测是一个不适定的计算机视觉问题,近来受到广泛关注。其主要挑战在于视频内容的高变异性、误差随时间传播,以及未来帧的非确定性:给定一段过去帧序列,存在连续分布的多种可能未来。本工作引入双射门控循环单元(bijective Gated Recurrent Units),即 GRU 层输入输出间的双重映射。这使得带编码器与解码器间状态共享的循环自编码器成为可能,分层化序列表示并有助于防止容量问题。我们展示了在此拓扑下,仅分别需要应用编码器或解码器进行输入编码与预测。这降低了计算成本,并避免在生成帧序列时重新编码预测,从而缓解误差传播。此外,可从已训练模型中移除层,从而洞察各层作用并使模型更具可解释性。我们在三个视频数据集上评估了该方法,在 MMNIST 和 UCF101 上优于当前最优(SOTA)预测结果,并在 KTH 上以仅最佳评分方法 2 至 3 倍的内存占用与计算成本取得具竞争力的结果。
引用
@article{arxiv.1712.00311,
title = {Folded Recurrent Neural Networks for Future Video Prediction},
author = {Marc Oliu and Javier Selva and Sergio Escalera},
journal= {arXiv preprint arXiv:1712.00311},
year = {2018}
}
备注
Submitted to European Conference on Computer Vision