QuantSparse: 通过模型量化与注意力稀疏化全面压缩视频扩散Transformer
计算机视觉与模式识别
2026-03-10 v4
摘要
扩散Transformer展现出显著的视频生成能力,但其极高的计算与内存成本阻碍了实际部署。模型量化与注意力稀疏化是两种有前景的压缩方向,但各自在激进压缩下均会导致严重的性能下降。将二者结合有望产生复合效率增益,但朴素集成效果不佳。稀疏性引入的信息损失会加剧量化噪声,导致注意力偏移放大。为解决这一问题,我们提出\textbf{QuantSparse},一个将模型量化与注意力稀疏化统一的框架。具体而言,我们引入\textit{多尺度显著注意力蒸馏},利用全局结构引导与局部显著监督来缓解量化偏差。此外,我们开发了\textit{二阶稀疏注意力重参数化},利用二阶残差的时序稳定性来高效恢复稀疏性下丢失的信息。在HunyuanVideo-13B上的实验表明,QuantSparse达到20.88 PSNR,显著优于最先进量化基线Q-VDiT(16.85 PSNR),同时实现\textbf{3.68}的存储缩减和\textbf{1.88}的端到端推理加速。我们的代码将发布于https://github.com/wlfeng0509/QuantSparse。
引用
@article{arxiv.2509.23681,
title = {QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification},
author = {Weilun Feng and Chuanguang Yang and Haotong Qin and Mingqiang Wu and Yuqi Li and Xiangqi Li and Zhulin An and Libo Huang and Yulun Zhang and Michele Magno and Yongjun Xu},
journal= {arXiv preprint arXiv:2509.23681},
year = {2026}
}
备注
Accepted by ICLR 2026