中文

层级量化:超越整数位级别的 LLM 量化的实用且有效的方法

计算与语言 2024-10-29 v3 人工智能 机器学习

摘要

我们提出一种简单的数值量化方法,对大语言模型(LLM)的不同层以不同的比特级别进行量化,该方法独立于底层量化技术。具体而言,我们将最重要的层量化为更高的位精度,而将不重要的层量化为更低的位数。我们提出了两种有效的策略来衡量 LLM 中各层的重要性:第一种方法基于该层输出嵌入与输入嵌入之间的差异来衡量重要性(差异越大越好);第二种方法则通过估计该层中多少权重远大于平均值的权重来衡量重要性(数值越小越好)。我们展示,根据我们的重要性得分对不同层以可变位数进行量化,可实现最小的性能下降,同时显著缩小模型规模。最后,我们从变量层级量化实验中提炼出几个实用性的关键经验教训:(a) 在我们的重要性排序下,将25-50%的层移至更低的量化级别时,LLM性能仍接近原始模型;若不采用特定的排序则仅能维持至5-10%;(b) 将层级重要性引入本质上具有动态特性的量化技术,可进一步提升其性能,表明我们的做法与其他动态量化方法是互补的;(c) 将 LLM 量化至更低位数的效果优于剪枝,除非使用极端量化(2 位);(d) 针对具有更多层的大型 LLM,层级量化至更低位数的效果优于针对较小且层数较少的 LLM。我们的代码已公开发布于 https://github.com/RazvanDu/LayerwiseQuant/。

关键词

引用

@article{arxiv.2406.17415,
  title  = {Layer-Wise Quantization: A Pragmatic and Effective Method for Quantizing LLMs Beyond Integer Bit-Levels},
  author = {Razvan-Gabriel Dumitru and Vikas Yadav and Rishabh Maheshwary and Paul-Ioan Clotan and Sathwik Tejaswi Madhusudhan and Mihai Surdeanu},
  journal= {arXiv preprint arXiv:2406.17415},
  year   = {2024}
}