视频(语言)建模:自然视频生成模型的基线
机器学习
2016-05-05 v5 计算机视觉与模式识别
摘要
我们提出了一种利用视频数据进行无监督特征学习的强基线模型。通过学习预测输入视频序列中缺失的帧或外推未来帧,该模型能够发现对表示复杂形变和运动模式有用的时空相关性。我们提出的模型很大程度上借鉴了语言建模文献,并通过将图像块空间量化为一个大型字典来适应视觉领域。我们在填充和生成两个任务上展示了该方法。我们首次证明,在自然视频上训练后,这样的模型能够预测短视频序列中的非平凡运动。
引用
@article{arxiv.1412.6604,
title = {Video (language) modeling: a baseline for generative models of natural videos},
author = {MarcAurelio Ranzato and Arthur Szlam and Joan Bruna and Michael Mathieu and Ronan Collobert and Sumit Chopra},
journal= {arXiv preprint arXiv:1412.6604},
year = {2016}
}