中文

基于正交信息(光流与纹理)的分层视频生成

计算机视觉与模式识别 2017-12-04 v2

摘要

从无标签数据学习表示并生成视频是一个非常具有挑战性的问题。要生成逼真视频,不仅需要确保每帧外观真实,还需确保视频运动的合理性与视频外观在时间方向上的连续性。视频生成过程应依据这些内在困难进行划分。本研究中,我们关注运动与外观信息作为视频的两个重要正交分量,并提出由FlowGAN与TextureGAN组成的流与纹理生成对抗网络(FTGAN)。为避免巨大的标注代价,我们必须探索从无标签数据学习的方法。因此,我们采用光流作为运动信息以生成视频。FlowGAN生成光流,其仅包含待生成视频的边缘与运动。另一方面,TextureGAN专用于为FlowGAN生成的光流赋予纹理。这种分层方法带来了具有合理运动与外观一致性的更真实视频。我们的实验表明,与先前GAN工作相比,我们的模型生成了更合理的运动视频,并在无监督动作分类上取得显著改进性能。此外,由于我们的模型从两个独立信息生成视频,可生成训练数据中未出现的运动与属性新组合,例如在棒球场上做仰卧起坐的人物视频。

关键词

引用

@article{arxiv.1711.09618,
  title  = {Hierarchical Video Generation from Orthogonal Information: Optical Flow and Texture},
  author = {Katsunori Ohnishi and Shohei Yamamoto and Yoshitaka Ushiku and Tatsuya Harada},
  journal= {arXiv preprint arXiv:1711.09618},
  year   = {2017}
}

备注

Our supplemental material is available on http://www.mi.t.u-tokyo.ac.jp/assets/publication/hierarchical_video_generation_sup/ Accepted to AAAI2018