中文

FutureGAN:在渐进生长 GAN 中使用时空三维卷积预测视频序列的未来帧

计算机视觉与模式识别 2018-11-27 v2

摘要

我们提出一种新的编码器-解码器 GAN 模型 FutureGAN,该模型以一段过去帧序列为条件预测视频序列的未来帧。训练期间,网络仅接收原始像素值作为输入,不依赖额外约束或数据集特定条件。为捕获视频序列的时空分量,所有编码器与解码器模块均使用时空三维卷积。此外,我们借鉴现有渐进生长 GAN (PGGAN) 的理念,其在生成高分辨率单幅图像上取得了高质量结果。FutureGAN 模型将此理念拓展至视频预测这一复杂任务。我们在 MovingMNIST、KTH Action 与 Cityscapes 三个不同数据集上进行了实验。结果表明,该模型为所有三个数据集有效地学习了将输入序列信息转换为合理未来序列的表示。FutureGAN 框架的主要优势在于其无需额外改动即可适用于多种不同数据集,同时取得稳定结果,可与视频预测领域的当前最优(state-of-the-art)方法竞争。我们的代码见 https://github.com/TUM-LMF/FutureGAN。

关键词

引用

@article{arxiv.1810.01325,
  title  = {FutureGAN: Anticipating the Future Frames of Video Sequences using Spatio-Temporal 3d Convolutions in Progressively Growing GANs},
  author = {Sandra Aigner and Marco Körner},
  journal= {arXiv preprint arXiv:1810.01325},
  year   = {2018}
}