中文

基于切片 Wasserstein GAN 渐进生长的高分辨率视频生成

计算机视觉与模式识别 2018-12-07 v2 人工智能 机器学习

摘要

将图像生成扩展到视频生成被证明是一项非常困难的任务,因为视频的时间维度在生成过程中带来了额外的挑战。此外,由于内存和训练稳定性的限制,随着视频分辨率/时长的增加,生成变得愈发困难。在本工作中,我们利用生成对抗网络(GANs)的渐进生长思想以实现更高分辨率的视频生成。具体而言,我们首先生成低分辨率短时的视频样本,然后通过向当前网络添加新的时空卷积层,渐进地单独(或联合)增加分辨率和时长。从学习视频分布最原始的空间外观和时间运动出发,所提出的渐进方法增量地学习时空信息以生成更高分辨率的视频。此外,我们引入了切片版 Wasserstein GAN(SWGAN)损失以改善对高维且时空混合分布的视频数据的分布学习。SWGAN 损失将联合分布间的距离替换为单维边缘分布间的距离,使损失更易计算。我们在收集的包含 10,900 个视频的人脸视频数据集上评估所提模型,以生成 256x256x32 分辨率的逼真人脸视频。此外,我们的模型在无监督动作识别数据集 UCF-101 上达到了 14.57 的创纪录 inception score。

关键词

引用

@article{arxiv.1810.02419,
  title  = {Towards High Resolution Video Generation with Progressive Growing of Sliced Wasserstein GANs},
  author = {Dinesh Acharya and Zhiwu Huang and Danda Pani Paudel and Luc Van Gool},
  journal= {arXiv preprint arXiv:1810.02419},
  year   = {2018}
}

备注

Master Thesis from ETH Zurich, May 22, 2018