IntactKV: 通过保持枢轴标记完整来改进大语言模型量化
计算与语言
2024-05-28 v2 人工智能
摘要
大语言模型(LLMs)在自然语言处理中表现出色,但需要大量计算。为了缓解这一问题,人们探索了各种量化方法,然而它们会损害LLM的性能。本文揭示了LLM中一种先前被忽视的异常值类型。这些异常值将大部分注意力分数分配给输入的初始标记,称为枢轴标记(pivot tokens),它们对量化LLM的性能至关重要。鉴于此,我们提出IntactKV,从全精度模型中无损地生成枢轴标记的KV缓存。该方法简单易行,易于与现有量化解决方案结合,且无额外推理开销。此外,IntactKV可以作为额外的LLM参数进行校准,以最小的训练成本进一步提升量化LLM的性能。数学分析也证明IntactKV有效降低了量化误差的上界。实验结果表明,IntactKV在各种量化方法、不同LLM和下游任务上带来了一致的改进,达到了LLM量化的新最先进水平。代码可在https://github.com/ruikangliu/IntactKV获取。
引用
@article{arxiv.2403.01241,
title = {IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens Intact},
author = {Ruikang Liu and Haoli Bai and Haokun Lin and Yuening Li and Han Gao and Zhengzhuo Xu and Lu Hou and Jun Yao and Chun Yuan},
journal= {arXiv preprint arXiv:2403.01241},
year = {2024}
}
备注
Accepted by ACL 2024 findings