中文

VideoGPT:基于 VQ-VAE 与 Transformers 的视频生成

计算机视觉与模式识别 2021-09-16 v2 机器学习

摘要

我们提出 VideoGPT:一种概念上简单的架构,用于将基于似然的生成建模扩展到自然视频。VideoGPT 使用 VQ-VAE,通过采用 3D 卷积与轴向自注意力学习原始视频的下采样离散潜在表示。随后使用一个类 GPT 的简单架构,利用时空位置编码自回归地建模离散潜在变量。尽管公式简单且易于训练,我们的架构能够在 BAIR Robot 数据集上生成与 SOTA 的 GAN 视频生成模型相竞争的样片,并从 UCF-101 与 Tumbler GIF Dataset (TGIF) 生成高保真自然视频。我们希望我们提出的架构可作为基于 transformer 的视频生成模型极简实现的可复现参考。样片与代码见 https://wilson1yan.github.io/videogpt/index.html

关键词

引用

@article{arxiv.2104.10157,
  title  = {VideoGPT: Video Generation using VQ-VAE and Transformers},
  author = {Wilson Yan and Yunzhi Zhang and Pieter Abbeel and Aravind Srinivas},
  journal= {arXiv preprint arXiv:2104.10157},
  year   = {2021}
}

备注

Project website: https://wilson1yan.github.io/videogpt/index.html