中文

部分-KV 解码的残差质量守恒

机器学习 2026-05-08 v2 计算与语言

摘要

我们研究一种受控的部分-KV 解码设置,其中对 sink/tail 锚点和检索令牌集合计算确切未归一化 Softmax 贡献,而剩余的 prefill 令牌由残差估计表示。我们聚焦于查询依赖的确切支持已选定后的账务规则,仅将 exhaustive Top-K 用作 oracle 选择器,而非可部署的检索系统。该提出的规则保持主干语言模型和 exact-branch KV 张量不变。它从学习得到的正特征图 ϕ\phi 构建固定大小的摘要状态 (S,u)(S,u),从检索令牌特征贡献中减去,以保持 exact 和 residual 集合不重叠,并将估计的残差分子和分母与 exact 分支在同一归一化下合并。在 1% 的 exact-support 预算下,残差完成方法在 RULER 和 BABILong 上对冻结的 1B 和 3B Llama-3.2-Instruct 主干模型在所有报告的上下文长度下均优于仅选择的 Top-K 基线。在 0.5-4% 的 exact-support 预算扫描中,该趋势基本持续。在 LongBench 上,摘要结果大多有利,而多文档问答则呈现混合态。注意力输出诊断支持检索令牌减法作为分区一致的账务规则,同时指出主要剩余误差来自对未检索残差质量的 imperfect 学习得到的 ϕ\phi 近似。

关键词

引用

@article{arxiv.2604.05438,
  title  = {Residual-Mass Accounting for Partial-KV Decoding},
  author = {Yasuto Hoshi and Daisuke Miyashita and Jun Deguchi},
  journal= {arXiv preprint arXiv:2604.05438},
  year   = {2026}
}