中文

LLaMA3-70B系列在逐通道量化中的独特性

机器学习 2024-10-02 v2 人工智能

摘要

我们观察到LLaMA3/3.1-70B模型存在一种独特的量化相关行为,而这种行为在LLaMA2-70B以及LLaMA3/3.1/3.2-1B/3B/8B/405B模型中均不存在。量化是高效部署大型语言模型(LLM)的关键技术。W8A8训练后量化对模型精度的影响,特别是对最近发布的LLaMA3/3.1模型系列的影响,仍然存在争议。在本文中,我们探讨三个关键问题:是什么使得LLaMA3-70B模型系列对量化特别脆弱?为什么会这样?以及如何解决这个问题?我们实证研究了开放LLM排行榜上的多个LLM,发现LLaMA3-70B模型系列在使用W8A8逐通道训练后量化时,具有独特的精度下降行为。相比之下,其他模型系列,如LLaMA2、LLaMA3/3.1-8B、LLaMA3.2、Qwen、Mixtral、Mistral、Phi-3和Falcon,在W8A8下表现出鲁棒的性能。与先前将精度下降归因于激活值大动态范围的断言相反,我们的发现表明LLaMA3-70B的权重分布是导致其脆弱性的主要因素。通过仔细分析跨Transformer块的权重分布的独特特征,我们提出了两种在硬件/软件开销方面做出不同权衡的解决方案。首先,我们提出了一种混合策略,其中少于3%的层采用更精细的逐组W8A8量化粒度。其次,我们引入了一种双平滑策略,该策略在保持整体逐通道量化的同时,平衡权重和激活值之间的量化误差。实验结果表明,这两种策略都能在W8A8量化下有效保持整个LLaMA3-70B模型系列的精度,达到与其FP16对应版本相当的性能。

关键词

引用

@article{arxiv.2408.15301,
  title  = {The Uniqueness of LLaMA3-70B Series with Per-Channel Quantization},
  author = {Minghai Qin},
  journal= {arXiv preprint arXiv:2408.15301},
  year   = {2024}
}

备注

27 pages, 41 figures