中文

G3AN:用于视频生成的解耦外观与运动

计算机视觉与模式识别 2020-06-16 v3

摘要

创建逼真的人体视频面临着同时生成外观与运动的挑战。为应对此挑战,我们引入 G3^{3}AN,一种新颖的时空生成模型,旨在捕捉高维视频数据的分布并以解耦方式建模外观与运动。后者通过将外观与运动分解于三流生成器中实现,其中主流旨在建模时空一致性,而两个辅助流分别用多尺度外观与运动特征增强主流。广泛的定量与定性分析表明,我们的模型在面部表情数据集 MUG 和 UvA-NEMO,以及人体动作数据集 Weizmann 和 UCF101 上系统性且显著优于最先进方法。对所学潜表示的额外分析证实了外观与运动的成功分解。源代码与预训练模型已公开可用。

关键词

引用

@article{arxiv.1912.05523,
  title  = {G3AN: Disentangling Appearance and Motion for Video Generation},
  author = {Yaohui Wang and Piotr Bilinski and Francois Bremond and Antitza Dantcheva},
  journal= {arXiv preprint arXiv:1912.05523},
  year   = {2020}
}

备注

CVPR 2020, project link https://wyhsirius.github.io/G3AN/