StyleInV:一种用于无条件视频生成的时序风格调制反演网络
计算机视觉与模式识别
2023-09-01 v1 人工智能
摘要
无条件视频生成是一项具有挑战性的任务,涉及合成既连贯又时长较长的高质量视频。为应对该挑战,研究者已使用预训练的 StyleGAN 图像生成器进行高质量帧合成,并聚焦于运动生成器设计。运动生成器以自回归方式训练,采用沉重的 3D 卷积判别器以确保视频生成中的运动连贯性。本文中,我们提出一种新颖的运动生成器设计,其使用基于学习的 GAN 反演网络。我们方法中的编码器从图像编码到潜变量中捕获丰富且平滑的先验;给定初始生成帧的潜变量作为引导,我们的方法可通过在时间上调制反演编码器来生成平滑的未来潜变量。我们的方法享有稀疏训练的优势,并以初始帧引导的反演网络自然约束运动生成器的生成空间,从而免除了沉重判别器的需要。此外,当编码器与预训练 StyleGAN 生成器配对时,我们的方法支持通过简单微调实现风格迁移。在多个基准上开展的广泛实验证明了我们的方法在生成长时长、高分辨率视频且具有良好单帧质量与时间一致性方面的优越性。
引用
@article{arxiv.2308.16909,
title = {StyleInV: A Temporal Style Modulated Inversion Network for Unconditional Video Generation},
author = {Yuhan Wang and Liming Jiang and Chen Change Loy},
journal= {arXiv preprint arXiv:2308.16909},
year = {2023}
}
备注
ICCV 2023. Code: https://github.com/johannwyh/StyleInV Project page: https://www.mmlab-ntu.com/project/styleinv/index.html