自编码视频隐变量用于对抗式视频生成
计算机视觉与模式识别
2022-01-19 v1
摘要
鉴于视频信号的三维复杂性,由于数据空间中涉及的大量随机性,训练一个鲁棒且多样的基于 GAN 的视频生成模型是繁重的。学习数据的解耦表示有助于提升鲁棒性并在采样过程中提供控制。对于视频生成,近期该领域通过将对运动与外观视为正交信息并设计能高效解耦它们的架构而取得进展。这些方法依赖手工设计架构,对生成器施加结构先验以在隐空间中分解外观与运动编码。受近期基于自编码器的图像生成进展启发,我们提出 AVLAE(对抗式视频隐变量自编码器,Adversarial Video Latent AutoEncoder),这是一种双流隐变量自编码器,通过对抗训练学习视频分布。具体而言,我们提出在对抗设定下对视频生成器的运动与外观隐向量进行自编码。我们证明即便生成器中无显式结构组合,我们的方法也能学习解耦运动与外观编码。若干定性及定量实验证明了方法的有效性。
引用
@article{arxiv.2201.06888,
title = {Autoencoding Video Latents for Adversarial Video Generation},
author = {Sai Hemanth Kasaraneni},
journal= {arXiv preprint arXiv:2201.06888},
year = {2022}
}
备注
preprint