Squeeze10-LLM:通过分阶段混合精度量化方法将 LLM 权重压缩 10 倍
机器学习
2025-07-25 v1
摘要
部署大型语言模型 (LLM) 面临参数庞大和高计算成本的挑战。超低位量化可显著减少存储需求并加速推理,但极端压缩(即平均位宽 <= 2)常导致严重的性能下降。为此,我们提出 Squeeze10-LLM,有效地将 16 位 LLM 的权重压缩 10 倍。具体而言,Squeeze10-LLM 是一种分阶段混合精度后训练量化 (PTQ) 框架,通过对 80% 的权重量化为 1 位、20% 的权重量化为 4 位,实现平均 1.6 位每权重。我们引入 Squeeze10LLM 具有两个关键创新:Post-Binarization Activation Robustness (PBAR) 和 Full Information Activation Supervision (FIAS)。PBAR 是一种考虑量化对激活影响的权重显著性度量,提高了低位环境下的准确性。FIAS 是一种在量化期间保留完整激活信息的策略,用于缓解跨层的累积误差传播。在 LLaMA 和 LLaMA2 上的实验表明,Squeeze10-LLM 在子 2 位权重-only 量化方面实现了业界领先的性能,将六项零样本分类任务的平均准确率从 43% 提升至 56%——显著优于现有 PTQ 方法。我们将在发表后公开代码。
引用
@article{arxiv.2507.18073,
title = {Squeeze10-LLM: Squeezing LLMs' Weights by 10 Times via a Staged Mixed-Precision Quantization Method},
author = {Qingcheng Zhu and Yangyang Ren and Linlin Yang and Mingbao Lin and Yanjing Li and Sheng Xu and Zichao Feng and Haodong Zhu and Yuguang Yang and Juan Zhang and Runqi Wang and Baochang Zhang},
journal= {arXiv preprint arXiv:2507.18073},
year = {2025}
}