中文

LLM 训练后量化基准测试:全面分类、统一评估与比较分析

机器学习 2025-05-22 v4 人工智能

摘要

由于其高效性和低资源需求,训练后量化(Post-Training Quantization, PTQ)技术已被广泛采用于大语言模型(LLM)压缩。然而,当前的研究缺乏对每种 PTQ 策略的优势和适用场景的深入分析。此外,现有算法主要关注性能,忽略了模型大小、性能和量化位宽之间的权衡。为了缓解这些困惑,我们在本文中为 LLM PTQ 提供了一个新颖的基准测试。首先,为了支持我们的基准测试,我们通过审查现有主流方法的计算策略(例如,基于优化的、基于补偿的等),提出了一种全面的分类法。然后,我们对每类中的基线进行了广泛实验,涵盖了在广泛评估指标上具有各种大小(7B-70B)、位宽、训练级别(LLaMA1/2/3/3.1)、架构(Mixtral、DeepSeekMoE 和 Mamba)以及模态(LLaVA1.5 和 VILA1.5)的模型。通过对结果的比较分析,我们总结了每种 PTQ 策略的优势以及在考虑性能时的模型大小-位宽权衡。例如,我们的基准测试表明,基于补偿的技术表现出出色的跨架构鲁棒性,并且应重新审视超大型模型的超低位 PTQ。最后,我们进一步据此声称,补偿与其他 PTQ 策略的实用组合可以实现 SOTA 的多重鲁棒性。我们相信,我们的基准测试将为 LLM 的部署和未来 PTQ 方法的研究提供有价值的建议。我们在 https://github.com/zjq0455/PTQ_Benchmark 上提供了该基准测试的代码库。

关键词

引用

@article{arxiv.2502.13178,
  title  = {Benchmarking Post-Training Quantization in LLMs: Comprehensive Taxonomy, Unified Evaluation, and Comparative Analysis},
  author = {Jiaqi Zhao and Ming Wang and Miao Zhang and Yuzhang Shang and Xuebo Liu and Yaowei Wang and Min Zhang and Liqiang Nie},
  journal= {arXiv preprint arXiv:2502.13178},
  year   = {2025}
}

备注

17 pages, 3 fugures