G3AN:用于视频生成的解耦外观与运动
计算机视觉与模式识别
2020-06-16 v3
摘要
创建逼真的人体视频面临着同时生成外观与运动的挑战。为应对此挑战,我们引入 GAN,一种新颖的时空生成模型,旨在捕捉高维视频数据的分布并以解耦方式建模外观与运动。后者通过将外观与运动分解于三流生成器中实现,其中主流旨在建模时空一致性,而两个辅助流分别用多尺度外观与运动特征增强主流。广泛的定量与定性分析表明,我们的模型在面部表情数据集 MUG 和 UvA-NEMO,以及人体动作数据集 Weizmann 和 UCF101 上系统性且显著优于最先进方法。对所学潜表示的额外分析证实了外观与运动的成功分解。源代码与预训练模型已公开可用。
引用
@article{arxiv.1912.05523,
title = {G3AN: Disentangling Appearance and Motion for Video Generation},
author = {Yaohui Wang and Piotr Bilinski and Francois Bremond and Antitza Dantcheva},
journal= {arXiv preprint arXiv:1912.05523},
year = {2020}
}
备注
CVPR 2020, project link https://wyhsirius.github.io/G3AN/