用于视频预测的立方 LSTM
计算机视觉与模式识别
2019-04-23 v1
摘要
预测视频中的未来帧已成为计算机视觉与机器人学习领域一个有前景的研究方向。该问题的核心在于运动目标捕获与未来运动预测。目标捕获指明视频中哪些物体在运动,而运动预测描述它们未来的动态。受此分析的启发,我们提出一种用于视频预测的立方长短期记忆(Cubic Long Short-Term Memory, CubicLSTM)单元。CubicLSTM 由三个分支组成,即用于捕获运动物体的空间分支、用于处理运动的时间分支,以及用于结合前两个分支以生成预测帧的输出分支。沿空间分支与输出分支堆叠多个 CubicLSTM 单元,再沿时间分支演化,可形成立方循环神经网络(CubicRNN)。实验表明,在合成与真实世界数据集上,CubicRNN 比先前方法产生更准确的视频预测。
引用
@article{arxiv.1904.09412,
title = {Cubic LSTMs for Video Prediction},
author = {Hehe Fan and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:1904.09412},
year = {2019}
}
备注
Accepted to AAAI-2019