通过显著性感知式部分重训练提升大语言模型的超低位量化效果
摘要
大语言模型的日益广泛应用引发了对其推理期间资源使用强度在环境和经济方面的关切。为每个用户提供这些模型所需的能源和散热水资源都相当可观。模型压缩技术,如量化,可缩小大语言模型的规模,使其在资源效率方面更具优势,但可能带来性能下降。量化方法通过用低精度的量化值取代模型的高精度参数来压缩模型规模。目前已有方法中,ApiQ方法在最小的内存和时间开销下实现了卓越的精度保持。我们研究了两种想法,超越ApiQ的水平实现超低位量化性能。首先,我们考察了将现有量化感知训练技术与ApiQ的部分训练相结合的结果。我们表明,在有限的训练数据和冻结权重的情况下,这并不超过ApiQ的基线方法。这导致两个关键见解:(1)通过完全重训练获得的显著表示容量不太可能通过部分训练实现。(2)这种收益可能取决于使用大规模且多样化的数据集进行量化感知训练。其次,基于这两个见解,我们提出了一种超低位量化方法,基于ApiQ并在无需完全重训练的情况下扩展其性能。该方法公开可用,依赖于一种显著性感知正则化术语,在量化期间优先保留最有影响的参数。我们在LLaMA 7B和13B基准测试中进行了实验,结果表明该方法分别将ApiQ的精度降幅降低了10.85%和7.54%。该方法的Python实现已公开发布在GitHub https://github.com/TokuyuSou/ULB-SAPR 上。
引用
@article{arxiv.2504.13932,
title = {Enhancing Ultra-Low-Bit Quantization of Large Language Models Through Saliency-Aware Partial Retraining},
author = {Deyu Cao and Samin Aref},
journal= {arXiv preprint arXiv:2504.13932},
year = {2025}
}
备注
This is a post-peer-review accepted manuscript from the proceedings of the 22nd International Conference on Modeling Decisions for Artificial Intelligence (MDAI'25). The publisher authenticated version and full citation details are available on Springer's website (LNAI 15957). https://doi.org/10.1007/978-3-032-00891-6_28