WF-VAE: 基于小波驱动能量流提升视频 VAE 的方法
计算机视觉与模式识别
2025-04-14 v3 人工智能
摘要
视频变分自编码器(VAE)将视频编码到低维潜空间,是大多数潜在视频扩散模型(LVDMs)中的关键组件,以降低模型训练成本。然而,随着生成视频的分辨率和时长的增加,视频 VAE 的编码成本已成为训练 LVDMs 的瓶颈。此外,大多数 LVDMs 采用的块状推断方法在处理长时长视频时会导致潜空间不连续。解决计算瓶颈的关键在于将视频分解为离散组成部分并高效地编码关键信息。小波变换可将视频分解为多个频域组件并显著提升编码效率,因此我们提出了 Wavelet Flow VAE (WF-VAE),一种利用多级小波变换来促进低频能量流入潜表示的自编码器。此外,我们引入一种称为 Causal Cache 的方法,可在块状推断期间维持潜空间的完整性。与最先进的视频 VAE 相比,WF-VAE 在 PSNR 和 LPIPS 指标上均表现出优异性能,同时实现 2 倍的吞吐量提升和 4 倍的内存消耗降低,同时保持具竞争力的重构质量。我们的代码和模型已在 https://github.com/PKU-YuanGroup/WF-VAE 上提供。
关键词
引用
@article{arxiv.2411.17459,
title = {WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model},
author = {Zongjian Li and Bin Lin and Yang Ye and Liuhan Chen and Xinhua Cheng and Shenghai Yuan and Li Yuan},
journal= {arXiv preprint arXiv:2411.17459},
year = {2025}
}
备注
8 pages, 7 figures