V3GAN:分解背景、前景与运动以生成视频
计算机视觉与模式识别
2022-03-29 v1
摘要
视频生成是一项具有挑战性的任务,需要对视频中合理的空间与时间动态进行建模。受人类通过将场景划分为运动与静止成分来感知视频的启发,我们提出一种方法,将视频生成任务分解为前景、背景与运动的合成。前景与背景共同描述外观,而运动指定前景在视频中随时间的移动方式。我们提出 V3GAN,一种新颖的三分支生成对抗网络(GAN),其中两个分支建模前景与背景信息,第三个分支在无需任何监督的情况下建模时间信息。前景分支增强了我们新颖的特征级掩码层,有助于学习准确的前景与背景分离掩码。为鼓励运动一致性,我们进一步为视频判别器提出一种打乱损失(shuffling loss)。在合成及真实世界基准数据集上的大量定量与定性分析表明,V3GAN 以显著优势优于最先进(SOTA)方法。
引用
@article{arxiv.2203.14074,
title = {V3GAN: Decomposing Background, Foreground and Motion for Video Generation},
author = {Arti Keshari and Sonam Gupta and Sukhendu Das},
journal= {arXiv preprint arXiv:2203.14074},
year = {2022}
}