LeanVAE: 视频扩散模型的超高效重建VAE
计算机视觉与模式识别
2025-03-19 v1 图像与视频处理
摘要
近期潜在视频扩散模型(LVDM)的进展通过利用视频变分自编码器(Video VAE)将复杂的视频数据压缩到紧凑的潜在空间,彻底革新了视频生成。然而,随着 LVDM 训练的扩展,Video VAE 的计算开销成为关键瓶颈,特别是对于高分辨率视频的编码。为解决这一问题,我们提出了 LeanVAE,一种新颖且超高效的 Video VAE 框架,引入了两项关键创新:(1)基于邻域感知前馈(NAF)模块和非重叠块操作的轻量级架构,大幅降低计算成本;(2)集成小波变换和压缩感知技术以提升重建质量。大量实验验证了 LeanVAE 在视频重建和生成方面的优越性,特别是在提升现有 Video VAE 效率方面。我们的模型在保持具有竞争力的重建质量的同时,提供了高达 50 倍的 FLOPs 减少和 44 倍的推理速度提升,为可扩展、高效的视频生成提供了见解。我们的模型和代码可在 https://github.com/westlake-repl/LeanVAE 获取。
引用
@article{arxiv.2503.14325,
title = {LeanVAE: An Ultra-Efficient Reconstruction VAE for Video Diffusion Models},
author = {Yu Cheng and Fajie Yuan},
journal= {arXiv preprint arXiv:2503.14325},
year = {2025}
}