大语言模型量化技术的全面研究
机器学习
2024-11-06 v1 人工智能
计算与语言
摘要
自Transformer模型兴起以来,大语言模型(LLM)已在学术界和工业界得到广泛研究和应用,Transformer模型在人工智能方面展现了卓越性能。然而,LLM的计算需求巨大,运行所需的能源资源往往有限。例如,热门模型GPT-3拥有1750亿参数,存储需求为350 GB,对资源受限的物联网设备和嵌入式系统的部署构成了重大挑战。这些系统通常缺乏处理如此大规模模型的计算能力。量化技术通过将模型值的精度降低到更小的离散值集合,提供了一种有前景的解决方案,能够减小LLM的规模并加速推理。在本研究中,我们对机器学习领域内的量化技术进行了全面分析,特别聚焦于其在LLM中的应用。我们首先探讨了量化的数学理论,随后回顾了常见的量化方法及其实现方式。此外,我们详细考察了应用于LLM的若干主流量化方法,阐述了其算法和性能结果。
引用
@article{arxiv.2411.02530,
title = {A Comprehensive Study on Quantization Techniques for Large Language Models},
author = {Jiedong Lang and Zhehao Guo and Shuyu Huang},
journal= {arXiv preprint arXiv:2411.02530},
year = {2024}
}