CrossQuant:一种用于精确压缩大型语言模型的较小量化内核后训练量化方法
机器学习
2024-10-11 v1 人工智能
摘要
后训练量化(PTQ)是压缩大型语言模型(LLM)的有效技术。虽然许多研究聚焦于同时量化权重和激活,但仍面临在激活量化后维持LLM准确性的挑战。为调查其根本原因,我们将线性代数中的概念扩展到量化函数,以定义新术语“量化内核”,指的是被量化为零的激活元素的集合。通过对量化内核进行定量分析,我们发现这些元素对于维持量化后LLM的准确性至关重要。随着量化内核的减小,量化后LLM的精度得以提升。如果量化内核比例保持在OPT模型的19%以下,LLaMA模型的1%以下,则将激活量化为INT8的精度损失将可忽略不计。以发展具备小量化内核的量化方法为目标,我们提出CrossQuant:一种简单而有效的激活量化方法。CrossQuant通过行和列方向的最大绝对值向量进行交叉量化,实现OPT模型约16%的量化内核,LLaMA模型则低于0.1%。在6.7B至70B参数的LLM(LLaMA、OPT)上的实验结果表明,CrossQuant在语言建模、零样本和少量样本任务中改进或保持了困惑度和准确性。
关键词
引用
@article{arxiv.2410.07505,
title = {CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression},
author = {Wenyuan Liu and Xindian Ma and Peng Zhang and Yan Wang},
journal= {arXiv preprint arXiv:2410.07505},
year = {2024}
}