NestedKV:面向长上下文 KV 缓存压缩的嵌套内存路由
计算与语言
2026-05-27 v1
摘要
长上下文语言模型受限于键值(KV)缓存的内存占用。现有训练-free KV 压缩方法通常仅依据单一重要性信号(注意力、新鲜度、层级分配或键唯一性)对 token 排序,当有用上下文在全局唯一、局部情境或即时相关时,这种方法会变得脆弱。我们引入 NestedKV,这是一种受《嵌套学习》中的 Continuum Memory System 启发的仅键 KV 缓存压缩方法。NestedKV 维护全局、块级和滑动窗口键锚点,依据多时间尺度余弦异常对 token 进行打分,并通过无训练的外层学习器结合头自适应混合和惊讶门控 token 路由。该得分配合自适应 per-head 预算,无需训练或修改 LLM。在 RULER(4k--32k)、LooGLE、LongBench、LongBench-E、InfiniteBench 和 MMLU-Pro 等基准测试中,NestedKV 在保留缓存比例较小时性能最佳。Qwen3-4B 上,NestedKV 在 RULER 上比 KeyDiff 提升最高达 19.10 分,在 LongBench 上提升最高达 19.29 分;在 r=0.95 时,NestedKV 在 LongBench 上保留 37.32 分,而 KeyDiff 仅为 17.55 分。
引用
@article{arxiv.2605.26678,
title = {NestedKV: Nested Memory Routing for Long-Context KV Cache Compression},
author = {Hong Chen and Xiang Liu and Yubo Gao and Yuxuan Fan and Bo Wang and Yuanlin Chu and Yuanguo Lin and Xuming Hu},
journal= {arXiv preprint arXiv:2605.26678},
year = {2026}
}