Scissorhands:利用重要性持续假设在推理时对 LLM KV 缓存进行压缩
机器学习
2023-08-30 v2 计算与语言
摘要
大语言模型(LLMs)引发了新一轮令人振奋的 AI 应用浪潮。大规模部署这些模型需要大量内存资源。部署中的一个关键内存瓶颈来自上下文窗口。人们普遍认识到模型权重非常消耗内存;然而,在生成过程中存储的键值嵌入(KV 缓存)的大小可以轻易超过模型大小。KV 缓存的庞大尺寸限制了推理批大小,而批大小对高吞吐推理工作负载至关重要。受注意力分数中有趣现象的启发,我们提出重要性持续假设:仅有关键令牌(pivotal tokens)在某一时刻具有实质影响,才会显著影响其未来的生成。基于围绕该假设的经验验证与理论分析,我们提出了 Scissorhands,一种无需微调模型即可将 KV 缓存的内存使用维持在固定预算下的系统。本质上,Scissorhands 通过以更高概率存储关键令牌来管理 KV 缓存。我们验证 Scissorhands 在不损害模型质量的前提下将 KV 缓存的推理内存使用降低了至多 5 倍。我们进一步证明 Scissorhands 可与传统上用于压缩模型权重的 4 位量化相结合,实现至多 20 倍的压缩。
引用
@article{arxiv.2305.17118,
title = {Scissorhands: Exploiting the Persistence of Importance Hypothesis for LLM KV Cache Compression at Test Time},
author = {Zichang Liu and Aditya Desai and Fangshuo Liao and Weitao Wang and Victor Xie and Zhaozhuo Xu and Anastasios Kyrillidis and Anshumali Shrivastava},
journal= {arXiv preprint arXiv:2305.17118},
year = {2023}
}