中文

基于神经流的标签条件化下一帧视频生成

计算机视觉与模式识别 2019-10-25 v1 机器学习 机器学习

摘要

近期最先进的视频生成系统采用生成对抗网络(GANs)或变分自编码器(VAEs)来生成新视频。然而,VAE模型在面对次优的输入条件时通常会产生模糊输出,且已知GAN对于大尺寸输出是不稳定的。此外,这些模型的输出视频难以评估,部分原因是GAN损失函数并非收敛的准确度量。在这项工作中,我们提出使用一种称为Glow的最先进神经流生成器,以文本标签为条件逐帧生成视频。神经流模型比标准GAN更稳定,因为它们仅优化单一交叉熵损失函数,该函数是单调的并避免了GAN极小极大目标的循环收敛问题。此外,我们还展示了如何在保留每个“流”层可逆性的同时对Glow施加外部上下文条件。最后,我们通过在留出的视频验证集上计算交叉熵来评估所提出的Glow模型,以便通过消融研究比较所提模型的多个版本。我们展示了生成的视频并讨论了未来的改进。

关键词

引用

@article{arxiv.1910.11106,
  title  = {Label-Conditioned Next-Frame Video Generation with Neural Flows},
  author = {David Donahue},
  journal= {arXiv preprint arXiv:1910.11106},
  year   = {2019}
}

备注

Computer Vision class project, 9 pages