利用动作-外观描述文本的条件视频生成
计算机视觉与模式识别
2018-12-06 v2
摘要
得益于近期的生成对抗网络(GAN),自动视频生成领域获得了推动。然而,大多数现有方法无法使用文本描述控制生成视频的内容,在很大程度上丧失了其实用性。这尤其影响人类视频,因为其动作与外观极其多样。本文提出条件流与纹理 GAN(CFT-GAN),一种基于 GAN 的由动作-外观描述文本生成视频的方法。我们提出了一种通过两阶段生成流水线将描述文本(例如“一个穿蓝色牛仔裤的男人正在打高尔夫”)编码来生成视频的新方式。我们的 CFT-GAN 使用该描述文本为每一帧生成光流(动作)与纹理(外观)。因此,输出视频以合理方式反映了描述文本中指定的内容。此外,为训练我们的方法,我们构建了一个带描述文本的人类视频生成新数据集。我们通过消融研究和用户研究对提出的方法进行了定性与定量评估。结果表明,CFT-GAN 能够成功生成包含描述文本中所示动作与外观的视频。
引用
@article{arxiv.1812.01261,
title = {Conditional Video Generation Using Action-Appearance Captions},
author = {Shohei Yamamoto and Antonio Tejero-de-Pablos and Yoshitaka Ushiku and Tatsuya Harada},
journal= {arXiv preprint arXiv:1812.01261},
year = {2018}
}