中文

基于总变差距离的 Top-$k$ 稀疏注意力数学理论

机器学习 2025-12-09 v1 人工智能

摘要

我们发展了一个统一的数学框架,用于认证 Top-kk 注意力截断,并在分布层面和输出层面量化近似误差。对于单个注意力分布 PP 及其 Top-kk 截断 P^\hat P,我们证明总变差距离与被丢弃的 softmax 尾部质量一致,并满足 TV(P,P^)=1eKL(P^P)\mathrm{TV}(P,\hat P)=1-e^{-\mathrm{KL}(\hat P\Vert P)},从而以尖锐且特定于 Top-kk 的界取代通用不等式。由此我们推导出非渐近确定性界——从单边界间隙到多间隙及分块变体——仅利用有序 logit 来控制 TV(P,P^)\mathrm{TV}(P,\hat P)。利用精确的头尾分解,我们证明输出误差可分解为 Attn(q,K,V)Attnk(q,K,V)2=τμtailμhead2\|\mathrm{Attn}(q,K,V)-\mathrm{Attn}_k(q,K,V)\|_2=\tau\|\mu_{\mathrm{tail}}-\mu_{\mathrm{head}}\|_2,其中 τ=TV(P,P^)\tau=\mathrm{TV}(P,\hat P),由此得到新的头尾直径界 Attn(q,K,V)Attnk(q,K,V)2τdiamH,T\|\mathrm{Attn}(q,K,V)-\mathrm{Attn}_k(q,K,V)\|_2\le\tau\,\mathrm{diam}_{H,T},以及将误差与 VarP(V)\mathrm{Var}_P(V) 相关联的改进结果。在 i.i.d. 高斯得分模型 siN(μ,σ2)s_i\sim\mathcal N(\mu,\sigma^2) 下,我们推导出闭式尾部质量以及确保 TV(P,P^)ε\mathrm{TV}(P,\hat P)\le\varepsilon 的最小 kεk_\varepsilon 的渐近规则,即 kε/nΦc(σ+Φ1(ε))k_\varepsilon/n\approx\Phi_c(\sigma+\Phi^{-1}(\varepsilon))。在 bert-base-uncased 和合成 logit 上的实验证实了 kε/nk_\varepsilon/n 的预测缩放,并表明认证的 Top-kk 平均可将评分键减少 2–4×\times,同时满足规定的总变差预算。

关键词

引用

@article{arxiv.2512.07647,
  title  = {A Mathematical Theory of Top-$k$ Sparse Attention via Total Variation Distance},
  author = {Georgios Tzachristas and Lei Deng and Ioannis Tzachristas and Gong Zhang and Renhai Chen},
  journal= {arXiv preprint arXiv:2512.07647},
  year   = {2025}
}