通过线性定理推进大型语言模型量化的极限
机器学习
2024-11-27 v1
摘要
对大型语言模型进行量化已成为降低其内存和计算成本的标准方法。通常情况下,现有方法侧重于将问题分解为单个层级子问题,最小化各层的误差,所采用的指标可能并非最优。然而,当前方法缺乏理论依据,且所使用的指标可能并非最优。本文提出了一条“线性定理”,建立了层级 重构误差与模型因量化导致的困惑度提升之间的直接关系。该洞见使我们能够实现两项新颖应用:(1) 使用哈达德旋转和均方误差最优网格的简单无数据自由 LLM 量化方法,称为 HIGGS,超越了所有先前的数据自由方法,包括极其流行的 NF4 量化格式;(2) 通过动态规划求解,在中等位宽范围内找到与给定压缩约束相匹配的非均匀层级量化水平的最优解。实践方面,我们在 Llama-3.1 和 3.2 系列模型以及 Qwen 系列模型上展示了改进的精度-压缩权衡。进一步地,我们表明该方法在各种批量大小下都能有效地得到 GPU 内核的支持,推动了 LLM 的数据自由和非均匀量化。
引用
@article{arxiv.2411.17525,
title = {Pushing the Limits of Large Language Model Quantization via the Linearity Theorem},
author = {Vladimir Malinovskii and Andrei Panferov and Ivan Ilin and Han Guo and Peter Richtárik and Dan Alistarh},
journal= {arXiv preprint arXiv:2411.17525},
year = {2024}
}