中文

用于潜在视频扩散模型的改进视频VAE

计算机视觉与模式识别 2024-11-12 v1 图像与视频处理

摘要

变分自编码器(VAE)旨在将像素数据压缩到低维潜在空间,在OpenAI的Sora和其他潜在视频扩散生成模型中发挥重要作用。虽然大多数现有视频VAE将预训练的图像VAE扩展为3D因果结构以实现时空压缩,但本文呈现了两个令人惊讶的发现:(1)从具有相同潜在维度的良好训练图像VAE进行初始化会抑制后续时序压缩能力的提升。(2)因果推理的采用导致帧间不等的信息交互和不均衡的性能。为缓解这些问题,我们提出了一种基于关键帧的时序压缩(KTC)架构和一个组因果卷积(GCConv)模块以进一步改进视频VAE(IV-VAE)。具体而言,KTC架构将潜在空间分为两个分支,其中一半完全继承低维图像VAE中关键帧的压缩先验,而另一半通过3D组因果卷积进行时序压缩,减少了时空冲突并加速了视频VAE的收敛速度。上述3D一半中的GCConv在每组帧内使用标准卷积以确保帧间等价性,并在组之间采用因果逻辑填充以保持处理可变帧视频的灵活性。在五个基准上的广泛实验证明了所提出的IV-VAE(https://wpy1999.github.io/IV-VAE/)最先进的视频重建和生成能力。

关键词

引用

@article{arxiv.2411.06449,
  title  = {Improved Video VAE for Latent Video Diffusion Model},
  author = {Pingyu Wu and Kai Zhu and Yu Liu and Liming Zhao and Wei Zhai and Yang Cao and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2411.06449},
  year   = {2024}
}