中文

保护(几乎)就是你所需要的一切:结构保护在全局设限KV驱逐中主导评分

机器学习 2026-05-19 v1 计算与语言 密码学与安全 性能

摘要

我们在共享的全局设限解码时框架下研究KV缓存驱逐。七种策略(LRU、H2O、SnapKV、StreamingLLM、Ada-KV、QUEST、Random)共享一个提示边界脆弱性:在没有结构保护的情况下,它们在六个纯Transformer模型上崩溃至接近零的质量(F1\leq0.064)。在每个边界保留10%的缓存,可在 C=256C{=}256(13%保留率)下恢复七个LongBench模型上 C=2,048C{=}2{,}048 参考上限质量的69--90%;一个十模型面板的跨度为68--98%。一项注意力质量试点(Qwen2.5-3B,N=30N{=}30)指出了原因:位置0的汇聚点占据了约75%的前缀质量,而其他边界token接近约 0.41×0.41{\times} 均匀期望,因此注意力评分器保留了汇聚点但仍然丢弃了结构上关键的token。在保护下,简化的评分隔离变体在 K=32K{=}32 时与LRU达到TOST等效(Δ=0.02\Delta{=}0.02);在 K=8K{=}8 时,注意力策略成对收敛,但在 C=256C{=}256C=512C{=}512 下仍比LRU高出0.011--0.021 F1。忠实的Ada-KV/QUEST在Mistral-7B和Phi-3.5上比简化变体增加了约0.03--0.04 F1。在Qwen3-4B上进行的NIAH-32K机制迁移试点(解码对比预填充,C{512,2048}C{\in}\{512,2048\})显示了近乎相同的保护提升(比率0.99--1.00)。在64K下,保护有所帮助但恢复有限;只有在模型本身已支持无驱逐的强64K检索时,忠实的逐头评分才能在6.3%保留率下匹配Gemma-3-4B上的全缓存上限。总结:保护占主导地位;一旦边界得到保护,评分差异即为次要;逐头分配可带来进一步的适度增益。

关键词

引用

@article{arxiv.2605.18053,
  title  = {Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction},
  author = {Gabriel Garcia},
  journal= {arXiv preprint arXiv:2605.18053},
  year   = {2026}
}

备注

38 pages, 6 figures, 25 tables (includes one longtable). Code and figure regeneration scripts: https://github.com/gpgabriel25/KVCacheBoundaryProtection