中文

推理需要多少缓存?KV 压缩变换器中的深度-缓存权衡

机器学习 2026-04-21 v1 人工智能 计算复杂性

摘要

键值 (KV) 缓存是变换器推理中的主要内存瓶颈,然而关于其在压缩前对多步推理产生多大影响的理论认识极少。我们通过在 n 个标记上进行 k 步指针追逐,共享大小为 s 的 KV 缓存,注意力维度为 m,H 个注意力头,p 位精度,以及遵守局部性的缓存控制器(满足所有标准 KV 压缩方法的要求)来研究这一问题。我们给出三个结果。(1) 产品深度下界 (猜想)。我们猜想任何这样的变换器 (n ≥ 4k, s ≤ √n/4) 需要深度 L = Ω(⌈k/s⌉ · ⌈log₂n/(Hmp)⌉),并孤立唯一剩余的空隙为联合分布的缓存痕迹和指针链的概率步骤。无条件地,我们通过窗口指针翻倍证明了一个匹配的上界 L = O(min(k, ⌈k/s⌉ log s) · log n/(mp)),以及一个 max 界 L = Ω(max(⌈k/s⌉, log n/(Hmp)))。关闭猜想等价于将 max 升为 product。(2) 带宽障碍。仅当 Hmp ≲ log n 时,产品界限才起作用。任何通过 per-window 可区分性计数证明的下界——包括可达性、带宽和组合形式——在 Hmp ≥ log₂ n 时不能超过 ⌈k/s⌉。打破这一点需要将无条件的通信复杂度界限从指针追逐提升到 Cache-Transformer 深度。(3) 自适应 vs 随机错误缩放。在随机缓存下进行 T = ⌈log₂k⌉ 个 doubling 阶段,随机缓存给出 Pr[ℰ] ≤ (s/(n-T))^T + 2T³/n(指数级于 T),而自适应局部性尊重的缓存实现 Pr[ℰ] = s/n 精确,独立于 T。Ω((n/s)^(T-1)) 的分离解释了为何在多跳推理中重型 hitter 淘汰在实验上占主导地位。

关键词

引用

@article{arxiv.2604.17935,
  title  = {How Much Cache Does Reasoning Need? Depth-Cache Tradeoffs in KV-Compressed Transformers},
  author = {Xiao Wang},
  journal= {arXiv preprint arXiv:2604.17935},
  year   = {2026}
}