QVGen:突破量化视频生成模型的极限
计算机视觉与模式识别
2026-01-29 v5
摘要
视频扩散模型(DM)已能实现高质量的视频合成。然而,它们巨大的计算和内存需求给实际部署带来了严峻挑战,即使是在高端 GPU 上也是如此。作为一种普遍采用的解决方案,量化在降低图像 DM 成本方面已取得显著成功,但其直接应用于视频 DM 仍然效果不佳。在本文中,我们提出了 QVGen,一个新颖的量化感知训练(QAT)框架,专为在极低位量化(例如 4 位或更低)下实现高性能且推理高效的视频 DM 而设计。我们首先进行理论分析,证明降低梯度范数对于促进 QAT 收敛至关重要。为此,我们引入辅助模块()来减轻大的量化误差,从而显著增强收敛性。为了消除 的推理开销,我们提出了一种秩衰减策略,逐步消除 。具体来说,我们反复使用奇异值分解(SVD)和提出的基于秩的正则化 来识别并衰减低贡献成分。该策略在保持性能的同时,消除了额外的推理开销。在 4 个最先进(SOTA)的视频 DM 上进行的广泛实验(参数规模从 )表明,QVGen 是首个在 4 位设置下达到与全精度可比质量的方法。此外,它显著优于现有方法。例如,我们的 3 位 CogVideoX-2B 在 VBench 上的动态程度和场景一致性指标上分别提升了 和 。代码和模型可在 https://github.com/ModelTC/QVGen 获取。
引用
@article{arxiv.2505.11497,
title = {QVGen: Pushing the Limit of Quantized Video Generative Models},
author = {Yushi Huang and Ruihao Gong and Jing Liu and Yifu Ding and Chengtao Lv and Haotong Qin and Jun Zhang},
journal= {arXiv preprint arXiv:2505.11497},
year = {2026}
}
备注
Accepted by ICLR 2026