中文

GEAR:一种用于 LLM 近无损生成式推理的高效 KV 缓存压缩方案

机器学习 2024-10-02 v4 人工智能 计算与语言

摘要

键值(KV)缓存已成为加速大语言模型(LLMs)推理生成速度的事实标准。然而,随着序列长度增加,缓存需求的增长已将 LLM 推理转变为内存受限问题,显著制约了系统吞吐量。现有方法依赖于丢弃不重要的 token 或对全部条目进行均匀量化。然而,此类方法在表示压缩矩阵时往往产生较高的近似误差。自回归解码过程进一步放大了每一步的误差,导致模型生成出现严重偏差及性能下降。为应对这一挑战,我们提出了 GEAR,一个能够实现近无损高压缩比的 Efficient KV 缓存压缩框架。GEAR 首先对大多数量级相似的条目应用超低精度量化;随后利用低秩矩阵近似量化误差,并使用稀疏矩阵修正异常条目的个别误差。通过巧妙整合这三项技术,GEAR 能够充分发挥其协同潜力。实验表明,与替代方案相比,GEAR 实现了近无损的 4-bit KV 缓存压缩,吞吐量提升高达 2.38 倍,同时峰值内存大小减少高达 2.29 倍。我们的代码已在 https://github.com/HaoKang-Timmy/GEAR 公开。

关键词

引用

@article{arxiv.2403.05527,
  title  = {GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM},
  author = {Hao Kang and Qingru Zhang and Souvik Kundu and Geonhwa Jeong and Zaoxing Liu and Tushar Krishna and Tuo Zhao},
  journal= {arXiv preprint arXiv:2403.05527},
  year   = {2024}
}