加速大型语言模型推理的GQSA:组级量化与稀疏化
机器学习
2025-07-29 v4
摘要
模型压缩已成为减少内存使用和计算开销的主流解决方案。本文提出了组级量化稀疏加速(GQSA),一种针对大型语言模型(LLM)的新型压缩技术。传统方法通常仅专注于量化或稀疏化,但单一策略往往在高压缩率下会导致显著性能损失。相比之下,GQSA将量化和稀疏化紧密集成,利用GPU友好的结构化组稀疏和量化实现高效加速。基于系统-算法协同设计原则,我们提出了两阶段稀疏优化策略,确保压缩模型的性能优越。 在引擎端,我们引入了“任务导向”并行策略,据称这是稀疏计算领域的首次应用。相较于传统的2:4稀疏方法,GQSA提供了更灵活可调的稀疏率以及更高的权重压缩率,并且与权重-only量化方法高度兼容。实验结果表明,在GQSA W4S50%压缩设置下,模型的准确率超过了2:4剪枝和W2量化方法。此外,在推理层面,GQSA相对于W2快1.26倍,相对于2:4剪枝快2.35倍。
引用
@article{arxiv.2412.17560,
title = {GQSA: Group Quantization and Sparsity for Accelerating Large Language Model Inference},
author = {Chao Zeng and Songwei Liu and Shu Yang and Fangmin Chen and Lean Fu and Xing Mei},
journal= {arXiv preprint arXiv:2412.17560},
year = {2025}
}
备注
14 pages