中文

StyleVideoGAN:一种基于预训练 StyleGAN 的时间生成模型

计算机视觉与模式识别 2021-12-01 v2

摘要

生成对抗模型(GAN)在静态图像的视觉质量以及时间相关性学习方面不断取得进展。然而,很少有工作能够将这两种有趣的能力结合起来用于视频内容合成:大多数方法需要大量的训练数据集来学习时间相关性,同时其输出的分辨率和视觉质量相当有限。我们提出了一种新颖的视频合成问题方法,可大幅提升视觉质量,并大幅减少生成视频所需的训练数据量和资源。我们的公式将合成单帧的空间域与生成运动的时间域分离。对于空间域,我们使用预训练的 StyleGAN 网络,其潜空间允许控制其所训练对象的外观。该模型的表达能力使我们能够将训练视频嵌入 StyleGAN 潜空间。我们的时间架构随后不是在 RGB 帧序列上训练,而是在 StyleGAN 潜码序列上训练。StyleGAN 空间的有利特性简化了时间相关性的发现。我们证明,仅需对 1 个对象约 10 分钟的 footage 训练约 6 小时即可。训练后,我们的模型不仅能为训练对象生成新的肖像视频,还能为任何可嵌入 StyleGAN 空间的随机对象生成。

关键词

引用

@article{arxiv.2107.07224,
  title  = {StyleVideoGAN: A Temporal Generative Model using a Pretrained StyleGAN},
  author = {Gereon Fox and Ayush Tewari and Mohamed Elgharib and Christian Theobalt},
  journal= {arXiv preprint arXiv:2107.07224},
  year   = {2021}
}

备注

Final draft