基于残差向量的图像与视频联合生成训练
机器学习
2019-12-18 v1 计算机视觉与模式识别
机器学习
摘要
在这项工作中,我们提出一种建模技术,用于联合训练图像和视频生成模型,通过同时学习将具有固定先验的潜变量映射到真实图像,并在图像间进行插值以生成视频。所提方法利用残差向量对表示中的变化进行建模,该残差向量编码了整个视频的摘要向量在每个时间步上的变化。我们利用该技术在固定先验下联合训练图像生成模型与无诸如解耦等约束的视频生成模型。联合训练使图像生成器能够利用时间信息,而视频生成模型则学习跨帧灵活共享信息。此外,实验结果验证了我们的方法兼容在视频或图像上的预训练,以及包含在两者混合的数据集上的训练。一套全面的定量与定性评估揭示了相较于视频生成和图像生成基线的样本质量与多样性的提升。我们进一步通过将该方法应用于基于将视频分解为运动与内容的模型,展示了其利用跨帧特征相似性的能力。所提模型允许内容在跨帧时有微小变化,同时通过编码姿态或运动特征的潜向量保持时间依赖性。
引用
@article{arxiv.1912.07991,
title = {Jointly Trained Image and Video Generation using Residual Vectors},
author = {Yatin Dandi and Aniket Das and Soumye Singhal and Vinay P. Namboodiri and Piyush Rai},
journal= {arXiv preprint arXiv:1912.07991},
year = {2019}
}
备注
Accepted in 2020 Winter Conference on Applications of Computer Vision (WACV '20)