迈向平滑视频合成
计算机视觉与模式识别
2022-12-15 v1
摘要
视频生成需要随时间合成具有动态内容的一致且持续的帧。本工作研究了对任意长度(从几帧到甚至无限长)视频进行合成的时间关系建模,使用生成对抗网络(GANs)。首先,针对相邻帧的合成,我们表明单图像生成的无混叠操作,加上充分预学习的知识,可带来平滑的帧过渡而不损害每帧质量。其次,通过将最初为视频理解设计的时序移位模块(TSM)整合进判别器,我们促使生成器合成更一致的动态。第三,我们提出了一种基于 B 样线的新运动表示,以确保时间平滑性从而实现无限长视频生成。它可以超越训练中所用的帧数。还提出了一种低秩时间调制,以缓解长视频生成中的内容重复。我们在多个数据集上评估了我们的方法,并显示出相较视频生成基线的显著改进。代码与模型将公开于 https://genforce.github.io/StyleSV。
引用
@article{arxiv.2212.07413,
title = {Towards Smooth Video Composition},
author = {Qihang Zhang and Ceyuan Yang and Yujun Shen and Yinghao Xu and Bolei Zhou},
journal= {arXiv preprint arXiv:2212.07413},
year = {2022}
}