基于正交信息(光流与纹理)的分层视频生成
计算机视觉与模式识别
2017-12-04 v2
摘要
从无标签数据学习表示并生成视频是一个非常具有挑战性的问题。要生成逼真视频,不仅需要确保每帧外观真实,还需确保视频运动的合理性与视频外观在时间方向上的连续性。视频生成过程应依据这些内在困难进行划分。本研究中,我们关注运动与外观信息作为视频的两个重要正交分量,并提出由FlowGAN与TextureGAN组成的流与纹理生成对抗网络(FTGAN)。为避免巨大的标注代价,我们必须探索从无标签数据学习的方法。因此,我们采用光流作为运动信息以生成视频。FlowGAN生成光流,其仅包含待生成视频的边缘与运动。另一方面,TextureGAN专用于为FlowGAN生成的光流赋予纹理。这种分层方法带来了具有合理运动与外观一致性的更真实视频。我们的实验表明,与先前GAN工作相比,我们的模型生成了更合理的运动视频,并在无监督动作分类上取得显著改进性能。此外,由于我们的模型从两个独立信息生成视频,可生成训练数据中未出现的运动与属性新组合,例如在棒球场上做仰卧起坐的人物视频。
引用
@article{arxiv.1711.09618,
title = {Hierarchical Video Generation from Orthogonal Information: Optical Flow and Texture},
author = {Katsunori Ohnishi and Shohei Yamamoto and Yoshitaka Ushiku and Tatsuya Harada},
journal= {arXiv preprint arXiv:1711.09618},
year = {2017}
}
备注
Our supplemental material is available on http://www.mi.t.u-tokyo.ac.jp/assets/publication/hierarchical_video_generation_sup/ Accepted to AAAI2018