中文

视频生成对抗网络:综述

计算机视觉与模式识别 2020-11-05 v1 机器学习 图像与视频处理

摘要

随着媒体、教育和娱乐等多个领域对内容创作的兴趣日益增长,使用 AI 算法生成图像、视频、音频和文本等内容的研究论文呈上升趋势。生成对抗网络(GANs)是一种有前景的模型,能够合成与真实数据样本相似的数据样本。尽管若干综述论文已在一定程度上涵盖了 GANs 模型的各类变体,但据我们所知,本文是最早综述最先进视频 GANs 模型的综述论文之一。本文首先将 GANs 综述论文分为通用 GANs 综述、图像 GANs 综述以及异常检测、医学影像或网络安全等特殊领域的 GANs 综述。接着,本文总结了那些最初并非为视频领域开发但已被多种视频 GANs 变体采用的 GANs 框架的主要改进。随后,根据是否存在条件,将视频 GANs 模型分为两大类进行全面综述。条件模型进一步按条件类型分为音频、文本、视频和图像。最后,本文指出了当前视频 GANs 模型的主要挑战与局限。补充材料中提供了数据集、所用损失函数和评估指标的详尽列表。

关键词

引用

@article{arxiv.2011.02250,
  title  = {Video Generative Adversarial Networks: A Review},
  author = {Nuha Aldausari and Arcot Sowmya and Nadine Marcus and Gelareh Mohammadi},
  journal= {arXiv preprint arXiv:2011.02250},
  year   = {2020}
}

备注

24 pages