中文

基于微量级格式的大型语言模型后训练量化

机器学习 2024-10-17 v3 人工智能

摘要

大型语言模型(LLMs)凭借在复杂语言建模任务中的卓越性能而脱颈而出,但也面临着显著的计算和存储挑战。本文探索了量化技术以缓解这些挑战的潜力。我们系统性地研究了三种众所周知的后训练技术(SmoothQuant、AWQ和GPTQ)的组合应用,并对其相互作用及其对推进LLM量化的意义进行了全面分析。我们通过启用对微量级(MX)格式的量化,扩展了这些方法的灵活性,使其适用于超出原始固定点格式目标的量化算法。我们表明,组合使用不同的PTQ方法可使我们使用MXINT格式将模型量化到4位权重和8位激活,几乎不损失与未压缩基准的准确性。

关键词

引用

@article{arxiv.2405.07135,
  title  = {Post Training Quantization of Large Language Models with Microscaling Formats},
  author = {Sayeh Sharify and Utkarsh Saxena and Zifei Xu and Wanzin Yazar and Ilya Soloveychik and Xin Wang},
  journal= {arXiv preprint arXiv:2405.07135},
  year   = {2024}
}