SPQ:大语言模型压缩的集成技术
计算与语言
2026-02-23 v1
摘要
本研究提出了一种集成技术,SPQ(SVD-修剪-量化),用于大型语言模型(LLM)压缩,结合了保留方差的奇异值分解(SVD)、基于激活值的修剪以及后训练线性量化。每个组件针对不同的效率瓶颈:i)修剪删除MLP层中冗余的神经元,ii)SVD将注意力投影减少为紧凑的低秩因子,iii)8位量化统一压缩所有线性层。在匹配的压缩比例下,SPQ在困惑度方面优于单个方法(仅SVD、仅修剪或仅量化),证明了组合互补技术的优势。应用于LLaMA-2-7B时,SPQ实现了最高75%的内存减少,同时保持或改善困惑度(例如WikiText-2从5.47降至4.91),并在C4、TruthfulQA和GSM8K等下游基准测试中保持准确性。与GPTQ和SparseGPT等强大基线相比,SPQ在困惑度和准确性方面表现出竞争力,同时使用更少的内存(6.86 GB vs. GPTQ的7.16 GB)。此外,SPQ提高了GPTQ的推理吞吐量,实现了最高1.9倍的加速,进一步增强了其在实际部署中的实用性。SPQ通过层级感知和互补压缩技术实现的稳健压缩,可能为内存受限环境中LLM的实际部署提供可能性。代码可在 https://github.com/JiaminYao/SPQ_LLM_Compression/ 获取。
引用
@article{arxiv.2602.18420,
title = {SPQ: An Ensemble Technique for Large Language Model Compression},
author = {Jiamin Yao and Eren Gultepe},
journal= {arXiv preprint arXiv:2602.18420},
year = {2026}
}
备注
Accepted to LREC 2026 Main Conference