中文

按你所述而创:从文本描述生成视频

计算机视觉与模式识别 2018-04-24 v1

摘要

我们每天都在各处创造多媒体内容。尽管自动内容生成数十年来一直是多媒体领域的一项根本性挑战,但深度学习的近期进展使该问题变得可行。例如,生成对抗网络(GANs)是一种用于合成图像的有效方法。然而,利用 GANs 生成视频并非易事。其困难源于视频的内在结构:视频是一系列视觉连贯且语义相关的帧。这促使我们在设计 GANs 生成视频时探索语义与时间连贯性。本文提出一种以文本描述为条件的新型时序生成对抗网络,即 TGANs-C,其中生成器网络的输入为潜噪声向量与描述嵌入的拼接,随后通过三维时空卷积变换为帧序列。与仅判断真假对的朴素判别器不同,我们的判别器还判断视频是否与正确描述相匹配。具体而言,判别器网络由三个判别器组成:视频判别器从生成视频中分类出真实视频并优化视频-描述匹配,帧判别器区分真实与伪造帧并将帧与条件描述对齐,以及运动判别器强调所生成视频中相邻帧应如真实视频般平滑连接的理念。我们在两个合成数据集(SBMG 和 TBMG)和一个真实世界数据集(MSVD)上定性展示了我们的 TGANs-C 在给定描述下生成合理视频的能力。此外,在 MSVD 上进行了定量实验,通过生成对抗度量与人工评测来验证我们的方案。

关键词

引用

@article{arxiv.1804.08264,
  title  = {To Create What You Tell: Generating Videos from Captions},
  author = {Yingwei Pan and Zhaofan Qiu and Ting Yao and Houqiang Li and Tao Mei},
  journal= {arXiv preprint arXiv:1804.08264},
  year   = {2018}
}

备注

ACM MM 2017 Brave New Idea