SLIM:面向 LLM 权重压缩的单次量化稀疏化低秩近似方法
机器学习
2025-08-18 v4 人工智能
性能
摘要
传统的 LLM 模型压缩技术旨在解决高内存消耗和推理速度慢的问题,但通常需要计算昂贵的重新训练才能保持准确性。相比之下,单次压缩方法消除了重新训练成本,但难以达到密集模型的准确性。本文提出了 SLIM,一种新的单次压缩框架,整体性地将硬件友好的量化、稀疏化和低秩近似集成到统一的流程中。首先,我们采用概率方法(SLIM-Quant)构建量化过程,以实现均匀量化。随后,我们使用现有的单次剪枝方法,对量化后的权重应用半结构化稀疏性。最后,为弥补引入的聚合量化和稀疏误差,我们提出了一种具有唯一可逆和可加特征的新型显著性函数,使我们能够数学上计算低秩适配器的值。SLIM 在 2:4 稀疏且 4 位权重量化情况下,使模型准确率提升最高可达 5.66%(LLaMA-2-7B),超越先前方法。使用 SLIM 压缩的模型在 Nvidia RTX3060 和 A100 GPU 上分别实现最高可达 4.3 倍和 3.8 倍的性能提升。此外,它们相对于稠密模型实现最高可达 0.23 倍的端到端内存降低。我们还提出了一种可选的 PEFT 配方,通过进一步微调,使准确率相较于无微调的 SLIM 提升最高可达 1.66%(LLaMA-2-13B)。
引用
@article{arxiv.2410.09615,
title = {SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression},
author = {Mohammad Mozaffari and Amir Yazdanbakhsh and Maryam Mehri Dehnavi},
journal= {arXiv preprint arXiv:2410.09615},
year = {2025}
}
备注
Published at Proceedings of the 42 nd International Conference on Machine Learning (ICML 2025)