扩展自回归视频模型
计算机视觉与模式识别
2020-02-12 v3 人工智能
机器学习
摘要
由于视频的统计复杂性、高度内在随机性以及海量数据,生成自然视频仍是一项具有挑战性的任务。最先进的视频生成模型常试图通过结合有时复杂、通常为视频专用的神经网络架构、潜变量模型、对抗训练以及一系列其他方法应对这些问题。尽管往往高度复杂,这些方法仍难以在狭窄领域之外生成高质量视频续帧,且常受困于保真度。相比之下,我们表明,基于三维自注意力机制、概念上简单的自回归视频生成模型在流行基准数据集的多个指标上取得了有竞争力的结果,并为这些数据集生成了高保真且逼真的续帧。我们还展示了在Kinetics上的训练结果,Kinetics是一个由展现摄像机运动、复杂物体交互和多样化人体运动等现象的YouTube视频组成的大规模动作识别数据集。尽管对这些现象的一致建模仍难以实现,我们希望包括偶发逼真续帧在内的结果能鼓励在如Kinetics等相对复杂的大规模数据集上开展进一步研究。
引用
@article{arxiv.1906.02634,
title = {Scaling Autoregressive Video Models},
author = {Dirk Weissenborn and Oscar Täckström and Jakob Uszkoreit},
journal= {arXiv preprint arXiv:1906.02634},
year = {2020}
}
备注
International Conference on Learning Representations (ICLR) 2020