OD-VAE:用于改善潜在视频扩散模型的全维视频压缩器
计算机视觉与模式识别
2024-09-10 v2 图像与视频处理
摘要
变分自编码器(VAE)将视频压缩为潜在表示,是潜在视频扩散模型(LVDMs)的关键前置组件。虽然OD-VAE的压缩更充分,但在保持相同重建质量的前提下,LVDMs的效率更高。然而,大多数LVDMs采用2D图像VAE,其对视频的压缩仅在空间维度上,往往被忽略了时间维度。如何在VAE中进行视频的时间压缩,以获得更简洁的潜在表示而又保持准确的重建,是本文所填补的空白。为此,我们提出了一种全维压缩VAE,称为OD-VAE,能够对视频进行时间和空间压缩。尽管OD-VAE的更充分的压缩给视频重建带来了很大的挑战,但通过我们细致的设计,仍能实现高质量的重建。为获得重建质量与压缩速度之间的更佳平衡,本文引入了OD-VAE的四个变体并进行分析。此外,设计了一种新的尾部初始化以更高效地训练OD-VAE,提出了一种新的推理策略,使OD-VAE能够在有限的GPU内存下处理任意长度的视频。针对视频重建和基于LVDM的视频生成进行了全面的实验,证明了我们提出方法的有效性和效率。
引用
@article{arxiv.2409.01199,
title = {OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model},
author = {Liuhan Chen and Zongjian Li and Bin Lin and Bin Zhu and Qian Wang and Shenghai Yuan and Xing Zhou and Xinhua Cheng and Li Yuan},
journal= {arXiv preprint arXiv:2409.01199},
year = {2024}
}
备注
https://github.com/PKU-YuanGroup/Open-Sora-Plan