中文

加速大型语言模型推理的GQSA:组级量化与稀疏化

机器学习 2025-07-29 v4

摘要

模型压缩已成为减少内存使用和计算开销的主流解决方案。本文提出了组级量化稀疏加速(GQSA),一种针对大型语言模型(LLM)的新型压缩技术。传统方法通常仅专注于量化或稀疏化,但单一策略往往在高压缩率下会导致显著性能损失。相比之下,GQSA将量化和稀疏化紧密集成,利用GPU友好的结构化组稀疏和量化实现高效加速。基于系统-算法协同设计原则,我们提出了两阶段稀疏优化策略,确保压缩模型的性能优越。 在引擎端,我们引入了“任务导向”并行策略,据称这是稀疏计算领域的首次应用。相较于传统的2:4稀疏方法,GQSA提供了更灵活可调的稀疏率以及更高的权重压缩率,并且与权重-only量化方法高度兼容。实验结果表明,在GQSA W4S50%压缩设置下,模型的准确率超过了2:4剪枝和W2量化方法。此外,在推理层面,GQSA相对于W2快1.26倍,相对于2:4剪枝快2.35倍。

关键词

引用

@article{arxiv.2412.17560,
  title  = {GQSA: Group Quantization and Sparsity for Accelerating Large Language Model Inference},
  author = {Chao Zeng and Songwei Liu and Shu Yang and Fangmin Chen and Lean Fu and Xing Mei},
  journal= {arXiv preprint arXiv:2412.17560},
  year   = {2025}
}

备注

14 pages