EMS:基于全局-局部重要性的头级KV缓存压缩的自适应逐出-合并策略
计算与语言
2025-02-28 v2
摘要
随着大型语言模型(LLM)不断发展,对长上下文的高质量和快速处理需求日益增长。KV缓存广泛用于存储先前生成的键值标记,有效减少推理期间的冗余计算。然而,随着内存开销成为重大关切,KV缓存的高效压缩受到日益关注的注意。大多数现有方法从两个角度进行压缩:识别重要标记和设计压缩策略。但这些方法常常因累积注意力得分或位置编码的影响,导致重要标记分布偏倚;此外,他们忽略了不同 heads 之间的稀疏性和冗余性,导致难以在 head 级别保留最有效信息。为此,我们提出EMS以克服这些限制,同时在极端压缩比下实现更好的KV缓存压缩。具体而言,我们引入一种结合全局和局部KV标记累积注意力得分的Global-Local得分,以更好地识别标记重要性。对于压缩策略,我们设计一种自适应且统一的Evict-then-Merge框架,考虑到不同 heads 之间KV标记的稀疏性和冗余性。此外,我们通过零类机制实现 head 级并行压缩,以提升效率。大量实验表明,我们在极端压缩比下实现了SOTA性能。EMS在LongBench上的256缓存预算下持续实现最低的困惑度,并在四个LLM上的得分提升超过1.28分;在Needle-in-a-Haystack任务中,缓存预算小于上下文长度的2%时,保留95%的检索准确率。
关键词
引用
@article{arxiv.2412.08521,
title = {EMS: Adaptive Evict-then-Merge Strategy for Head-wise KV Cache Compression Based on Global-Local Importance},
author = {Yingxin Li and Ye Li and Yuan Meng and Xinzhu Ma and Zihan Geng and Shutao Xia and Zhi Wang},
journal= {arXiv preprint arXiv:2412.08521},
year = {2025}
}