CV-VAE:用于潜在生成视频模型的兼容视频VAE
计算机视觉与模式识别
2024-10-24 v2 人工智能
图像与视频处理
摘要
视频的时空压缩利用诸如变分自编码器(VAE)的网络在OpenAI的SORA以及众多其他视频生成模型中发挥着关键作用。例如,许多类似LLM的视频模型学习来自3D VAE派生的离散 token 的分布 within VQVAE 框架,而大多数基于扩散的视频模型则捕获由2D VAE提取的连续潜在空间的分布。时序压缩仅通过均匀帧抽样实现,导致连续帧之间运动不够光滑。目前,研究社区缺乏一种常用的连续视频(3D)VAE用于潜在扩散-based 视频模型。此外,由于当前基于扩散的方法通常使用预训练的文本到图像(T2I)模型实现,直接训练一个不考虑与现有T2I模型兼容性的视频VAE将导致它们之间的潜在空间存在差距,这需要巨大的计算资源来弥合差距,即使使用T2I模型作为初始化亦然。为解决此问题,我们提出了一种用于训练视频VAE的方法,即CV-VAE,其潜在空间与给定图像VAE(例如Stable Diffusion的图像VAE)兼容。通过提出的 novel 潜在空间正则化实现兼容性,该正则化损失使用图像VAE。凭借潜在空间的兼容性,视频模型可以在真正的时空压缩潜在空间中,从预训练的T2I或视频模型无缝迁移,而不仅仅是在等间隔抽样视频帧。通过我们的CV-VAE,现有的视频模型可以在最小的微调情况下生成四倍的帧数。进行了大量实验以演示所提出视频VAE的有效性。
引用
@article{arxiv.2405.20279,
title = {CV-VAE: A Compatible Video VAE for Latent Generative Video Models},
author = {Sijie Zhao and Yong Zhang and Xiaodong Cun and Shaoshu Yang and Muyao Niu and Xiaoyu Li and Wenbo Hu and Ying Shan},
journal= {arXiv preprint arXiv:2405.20279},
year = {2024}
}
备注
Project Page: https://ailab-cvc.github.io/cvvae/index.html