用于自然视频序列预测的运动与内容分解
计算机视觉与模式识别
2018-01-09 v2
摘要
我们提出了一种用于预测自然视频序列中未来帧的深度神经网络。为了有效处理视频中像素的复杂演变,我们提议分解运动和内容,这是生成视频动态的两个关键组成部分。我们的模型建立在 Encoder-Decoder 卷积神经网络和卷积 LSTM 之上,用于像素级预测,它们分别捕获图像的空间布局和相应的时间动态。通过独立建模运动和内容,预测下一帧简化为通过识别出的运动特征将提取的内容特征转换为下一帧内容,从而简化了预测任务。我们的模型在多个时间步上可端到端训练,并且无需单独训练即可自然地学会分解运动和内容。我们使用 KTH、Weizmann action 和 UCF-101 数据集在人类活动视频上评估了所提出的网络架构。与近期方法相比,我们展示了 SOTA 的性能。据我们所知,这是首个具有运动和内容分离、可端到端训练的网络架构,用于对自然视频中的像素级未来预测进行时空动态建模。
引用
@article{arxiv.1706.08033,
title = {Decomposing Motion and Content for Natural Video Sequence Prediction},
author = {Ruben Villegas and Jimei Yang and Seunghoon Hong and Xunyu Lin and Honglak Lee},
journal= {arXiv preprint arXiv:1706.08033},
year = {2018}
}
备注
International Conference on Learning Representations (ICLR) 2017