LaCache:用于高效处理大型语言模型长上下文建模的梯形 KV 缓存
机器学习
2025-07-22 v1 人工智能
计算与语言
摘要
近期大型语言模型(LLM)的快速发展催生了大量需要强大长程能力的应用,这对于处理广泛的输入上下文和持续生成延长输出至关重要。随着序列长度的增加,LLM 中 Key-Value(KV)对的数量也随之急剧上升,成为显著的效率瓶颈。本文提出了一种新的 KV 缓存优化范式,称为 LaCache,这是一种用于高效且准确的 LLM 生成推断的训练自由方法。LaCache 使 LLM 能够同时解决长程建模中的两个关键挑战:强大的长程能力以及在不出现内存不足(OOM)的情况下持续生成。具体而言,LaCache 集成了两个关键创新:(1)一种梯形 KV 缓存模式,该模式不仅按顺序存储每个层中的 KV 对(从左到右),还跨层存储(从浅层到深层),在固定存储预算下提供更大的跨度,以捕获长程依赖,从而提升长程能力;(2)一种迭代压缩机制,该机制逐步压缩较旧的缓存,为新标记腾出空间。这种基于标记距离的动态压缩使我们能够在受限缓存预算下实现更有效的持续生成。实验在各种任务、基准和 LLM 模型上持续验证了 LaCache 在提升 LLM 长程能力方面的有效性。我们的代码已公开于 https://github.com/GATECH-EIC/LaCache。
引用
@article{arxiv.2507.14204,
title = {LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models},
author = {Dachuan Shi and Yonggan Fu and Xiangchi Yuan and Zhongzhi Yu and Haoran You and Sixu Li and Xin Dong and Jan Kautz and Pavlo Molchanov and Yingyan and Lin},
journal= {arXiv preprint arXiv:2507.14204},
year = {2025}
}
备注
ICML 2025. Code: https://github.com/GATECH-EIC/LaCache