基于总变差距离的 Top-$k$ 稀疏注意力数学理论
机器学习
2025-12-09 v1 人工智能
摘要
我们发展了一个统一的数学框架,用于认证 Top- 注意力截断,并在分布层面和输出层面量化近似误差。对于单个注意力分布 及其 Top- 截断 ,我们证明总变差距离与被丢弃的 softmax 尾部质量一致,并满足 ,从而以尖锐且特定于 Top- 的界取代通用不等式。由此我们推导出非渐近确定性界——从单边界间隙到多间隙及分块变体——仅利用有序 logit 来控制 。利用精确的头尾分解,我们证明输出误差可分解为 ,其中 ,由此得到新的头尾直径界 ,以及将误差与 相关联的改进结果。在 i.i.d. 高斯得分模型 下,我们推导出闭式尾部质量以及确保 的最小 的渐近规则,即 。在 bert-base-uncased 和合成 logit 上的实验证实了 的预测缩放,并表明认证的 Top- 平均可将评分键减少 2–4,同时满足规定的总变差预算。
引用
@article{arxiv.2512.07647,
title = {A Mathematical Theory of Top-$k$ Sparse Attention via Total Variation Distance},
author = {Georgios Tzachristas and Lei Deng and Ioannis Tzachristas and Gong Zhang and Renhai Chen},
journal= {arXiv preprint arXiv:2512.07647},
year = {2025}
}