中文

循环反卷积生成对抗网络及其在文本引导视频生成中的应用

计算机视觉与模式识别 2020-08-14 v1

摘要

本文提出一种用于视频生成的新型模型,并特别尝试处理由文本描述生成视频的问题,即基于给定文本合成逼真视频。现有视频生成方法由于帧不连续问题及其无文本生成方案,难以很好地适应此任务。为解决这些问题,我们提出一种循环反卷积生成对抗网络(RD-GAN),其包含作为生成器的循环反卷积网络(RDN)和作为判别器的三维卷积神经网络(3D-CNN)。RDN是传统循环神经网络的反卷积版本,能良好建模生成视频帧的长程时间依赖并充分利用条件信息。所提模型可通过促使RDN生成逼真视频从而让3D-CNN无法将其与真实视频区分开来而进行联合训练。我们将提出的RD-GAN应用于一系列任务,包括常规视频生成、条件视频生成、视频预测与视频分类,并通过取得良好性能证明了其有效性。

关键词

引用

@article{arxiv.2008.05856,
  title  = {Recurrent Deconvolutional Generative Adversarial Networks with Application to Text Guided Video Generation},
  author = {Hongyuan Yu and Yan Huang and Lihong Pi and Liang Wang},
  journal= {arXiv preprint arXiv:2008.05856},
  year   = {2020}
}