SurfaceLogicKV:仅需面向 KV 缓存压缩的 Surface 与 Logic 注意力行为
计算与语言
2025-08-25 v1 人工智能
摘要
大型语言模型(LLM)中输入序列长度的增加对 key-value(KV)缓存存储造成了显著压力,使得高效推理颇具挑战。我们通过自定义的 surface 记忆和 logic 构造注意力行为,揭示了长上下文推理中这些行为的关键作用。我们观察到,单个注意力头可以显示出各种行为,其中近 98.5% 有效地忽略完全无关的信息,其余 1.5% 表现为 logic 构造,0.5% 表现为 surface 记忆。基于层和头的集成,我们提出一种新颖的两阶段 SurfaceLogicKV 方法,用于利用这些注意力行为进行 KV 缓存压缩。结果显示,该方法在 various 任务和长序列上实现了 improved 压缩鲁棒性,同时保持竞争性能,甚至在某些特定情况下优于基线或 FullKV。
引用
@article{arxiv.2508.15806,
title = {SurfaceLogicKV: Surface and Logic Attention Behaviors are All You Need for Robust KV Cache Compression},
author = {Mengjie Li and William J. Song},
journal= {arXiv preprint arXiv:2508.15806},
year = {2025}
}
备注
18 pages, 9 tables, 10 pages