H3AE:视频扩散模型的高压缩、高速度、高质量自编码器
计算机视觉与模式识别
2025-10-02 v2 图像与视频处理
摘要
自编码器(AE)是隐式扩散模型在图像和视频生成中成功的关键,它降低了去噪分辨率并提高了效率。然而,AE的能力在网络设计、压缩率和训练策略方面长期被低估。在本工作中,我们系统地审视了架构设计选择并优化了计算分布,以获得一系列高效且高压缩率的视频AE,即使在移动设备上也能实时解码。我们还提出了一种全目标训练策略,以统一普通自编码器和图像条件I2V VAE的设计,在单个VAE网络中实现多功能性,同时提升质量。此外,我们提出了一种新颖的潜在一致性损失,为重建质量提供了稳定的提升。潜在一致性损失在质量提升和简洁性方面均优于先前的辅助损失,包括LPIPS、GAN和DWT。H3AE在GPU和移动设备上实现了超高的压缩率和实时解码速度,并在重建指标上大幅优于先前方法。最后,我们通过在隐式空间训练DiT来验证我们的AE,并展示了快速、高质量的文本到视频生成能力。
引用
@article{arxiv.2504.10567,
title = {H3AE: High Compression, High Speed, and High Quality AutoEncoder for Video Diffusion Models},
author = {Yushu Wu and Yanyu Li and Ivan Skorokhodov and Anil Kag and Willi Menapace and Sharath Girish and Aliaksandr Siarohin and Yanzhi Wang and Sergey Tulyakov},
journal= {arXiv preprint arXiv:2504.10567},
year = {2025}
}
备注
17 pages, 6 figures, 9 tables