基于微量级格式的大型语言模型后训练量化
机器学习
2024-10-17 v3 人工智能
摘要
大型语言模型(LLMs)凭借在复杂语言建模任务中的卓越性能而脱颈而出,但也面临着显著的计算和存储挑战。本文探索了量化技术以缓解这些挑战的潜力。我们系统性地研究了三种众所周知的后训练技术(SmoothQuant、AWQ和GPTQ)的组合应用,并对其相互作用及其对推进LLM量化的意义进行了全面分析。我们通过启用对微量级(MX)格式的量化,扩展了这些方法的灵活性,使其适用于超出原始固定点格式目标的量化算法。我们表明,组合使用不同的PTQ方法可使我们使用MXINT格式将模型量化到4位权重和8位激活,几乎不损失与未压缩基准的准确性。
引用
@article{arxiv.2405.07135,
title = {Post Training Quantization of Large Language Models with Microscaling Formats},
author = {Sayeh Sharify and Utkarsh Saxena and Zifei Xu and Wanzin Yazar and Ilya Soloveychik and Xin Wang},
journal= {arXiv preprint arXiv:2405.07135},
year = {2024}
}