VideoGPT:基于 VQ-VAE 与 Transformers 的视频生成
计算机视觉与模式识别
2021-09-16 v2 机器学习
摘要
我们提出 VideoGPT:一种概念上简单的架构,用于将基于似然的生成建模扩展到自然视频。VideoGPT 使用 VQ-VAE,通过采用 3D 卷积与轴向自注意力学习原始视频的下采样离散潜在表示。随后使用一个类 GPT 的简单架构,利用时空位置编码自回归地建模离散潜在变量。尽管公式简单且易于训练,我们的架构能够在 BAIR Robot 数据集上生成与 SOTA 的 GAN 视频生成模型相竞争的样片,并从 UCF-101 与 Tumbler GIF Dataset (TGIF) 生成高保真自然视频。我们希望我们提出的架构可作为基于 transformer 的视频生成模型极简实现的可复现参考。样片与代码见 https://wilson1yan.github.io/videogpt/index.html
引用
@article{arxiv.2104.10157,
title = {VideoGPT: Video Generation using VQ-VAE and Transformers},
author = {Wilson Yan and Yunzhi Zhang and Pieter Abbeel and Aravind Srinivas},
journal= {arXiv preprint arXiv:2104.10157},
year = {2021}
}
备注
Project website: https://wilson1yan.github.io/videogpt/index.html