FlexiCache: 利用注意力头的时间稳定性实现高效的 KV 缓存管理
机器学习
2026-04-21 v2
摘要
大型语言模型(LLM)服务日益受到不断增长的键值(KV)缓存大小的限制,该缓存随上下文长度和生成长度同步扩展。先前的研究表明注意力由一小部分关键令牌主导,但现有系统在高效利用这一特性方面存在困难,尤其在长生成长度场景中容易降低准确性。我们提出了一个关键观察:这些关键令牌的时间稳定性在 KV 头之间差异显著——某些头持续关注相同的令牌,而其他头则频繁切换。基于这一洞察,我们引入了 FlexiCache,一个分层 KV 缓存管理系统,利用 KV 头的时间稳定性来减少 GPU 内存使用和计算开销,同时保持模型准确性。FlexiCache 将 KV 头分类为稳定或不稳定:它保留不稳定头的所有 KV 缓存页在 GPU 内存中,而对于稳定头,则仅在 GPU 上保留前 K 页,其余卸载到主机内存。通过利用时间稳定性,FlexiCache 对稳定头执行周期性重排序以获取新提升的顶级页。FlexiCache 基于 vLLM 实现,将长上下文请求的 GPU 内存占用最多减少 70%,离线服务吞吐量提升 1.38–1.55 倍,在线令牌延迟降低 1.6–2.1 倍,同时在长上下文和长生成场景中保持准确性。
引用
@article{arxiv.2511.00868,
title = {FlexiCache: Leveraging Temporal Stability of Attention Heads for Efficient KV Cache Management},
author = {Nazmul Takbir and Hamidreza Alikhani and Nikil Dutt and Sangeetha Abdu Jyothi},
journal= {arXiv preprint arXiv:2511.00868},
year = {2026}
}
备注
Accepted at MLSys-2026