中文

PrefixQuant: 通过前缀Token消除大语言模型量化中的离群值

机器学习 2025-01-28 v2 计算与语言

摘要

现有的大语言模型权重激活量化方法主要处理通道级离群值,但常常忽略token级离群值,这限制了量化模型的精度。在这项工作中,我们提出PrefixQuant,一种新颖的量化方法,通过有效隔离token级离群值,在各种精度水平(W4A4KV4和W4A8KV4)和粒度(动态和静态量化)上实现了最先进的性能。首先,PrefixQuant通过在KV缓存中为离群token添加前缀来消除token级离群值,这一过程无需训练且非常高效(例如,对于Llama-3-70B只需1分钟)。其次,PrefixQuant引入了新的可训练参数用于逐块训练,以补偿量化误差。我们的实验表明,即使在更粗糙的静态量化设置下,PrefixQuant也显著优于现有的动态量化方法。例如,在W4A4KV4 Llama-3-8B上,PrefixQuant在动态和静态量化设置下的五个零样本推理任务上,分别比SpinQuant(动态量化)平均提高了+3.08和+2.85个百分点的准确率。此外,我们展示了使用W4A4 PrefixQuant的LLM实现了高达2.74倍的预填充加速和2.16倍的解码加速。我们的代码可在https://github.com/ChenMnZ/PrefixQuant获取。

关键词

引用

@article{arxiv.2410.05265,
  title  = {PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization},
  author = {Mengzhao Chen and Yi Liu and Jiahao Wang and Yi Bin and Wenqi Shao and Ping Luo},
  journal= {arXiv preprint arXiv:2410.05265},
  year   = {2025}
}

备注

PrefixQuant improves quantization accuracy across various precision and quantization settings