中文

等价的幻象:KV 缓存自回归推理中 FP16 的系统性分歧

机器学习 2026-04-20 v1 人工智能

摘要

KV 缓存是自回归 Transformer 推理中普遍采用的优化方法,长期以来被认为在数值上与无缓存计算等价。这一假设在标准 FP16 精度下并不成立:缓存开启(cache-ON)和缓存关闭(cache-OFF)的执行路径采用不同的浮点累加顺序,由于 FP16 的非结合性,导致解码出的 token 序列产生确定性分歧。在 GSM8K 上对三个开源模型(LLaMA-2-7B、Mistral-7B-v0.3、Gemma-2-2B)的评估中,我们观察到在所有采样策略(包括贪心解码)下 token 分歧率均为 100%,这排除了采样随机性作为原因,并且在 9 种条件中的 8 种条件下,cache-ON 产生了更高的准确率,该准确率差异表明分歧方向是系统性的而非随机的。受控的 FP32 证伪实验将分歧降低了八个数量级,消除了 token 翻转,并将翻转率降至精确的 0.0%,证实了 FP16 的非结合性是唯一的因果驱动因素。逐层漂移分析揭示了架构上可预测的传播模式:使用分组查询注意力(Grouped-Query Attention)的模型在第一层出现急剧分歧,而 Gemma 更大的头维度和滑动窗口注意力在所有层产生均匀的累积。最后,对整个残差流进行激活修补未能恢复无缓存轨迹,将因果变量定位到有状态的 KV 缓存。这些发现确立了 FP16 KV 缓存推理从根本上不等价于重新计算,并为理解现代 LLM 推理系统中的数值不稳定性提供了一个机制框架。

关键词

引用

@article{arxiv.2604.15409,
  title  = {The Illusion of Equivalence: Systematic FP16 Divergence in KV-Cached Autoregressive Inference},
  author = {Ranjith Chodavarapu and Lei Xu},
  journal= {arXiv preprint arXiv:2604.15409},
  year   = {2026}
}