多头注意力作为集成 Nadaraya-Watson 估计:方差缩减、解相关与最优头多样性
摘要
我们发展了对多头注意力(MHA)作为 Nadaraya-Watson(NW)核回归估计器集成的严格统计理论。基于单头 softmax 注意力与 NW 估计器之间的代数同一性,我们证明 MHA 是 H 个 NW 估计器的结构化集成,每个估计器在 key 空间的不同学习投影子空间中运行。我们推导了 MHA 均方误差的显式 Bias-Variance-Covariance 分解,表明方差缩减不仅取决于头数 H,也根本取决于头输出的解相关性。解相关性由学习投影子空间之间的主角度决定:正交投影实现最大方差缩减;对齐投影则实现 none。我们引入 Head Diversity Index(HDI),一种可计算的谱密度,衡量 inter-head 解相关性,并证明 MHA 均方误差随 HDI 单调递减。这提供了对经验观察到的注意力头专化的首个严格理论解释。在固定 total-dimension 预算 D = H * d_k 的情况下,我们解最优 head-dimension 分配问题,推导 MSE-minimizing 配对 (H*, d_k*) 由数据分布和回归光滑性决定。该解导出一种新的架构比例法:optimal per-head 维度随训练集大小对数增长,而 optimal 头数随 total 预算 D 几乎线性增长。我们的框架统一了三类先前工作:NW 单头注意力理论、ensemble learning 的 general weighting 理论,以及生物学与计算 ensemble 之间的 decorrelation-variance-reduction 同构关系。多头注意力是 Transformer 的实例化:identical agents plus diversity-enforcing mechanisms 于涌现最优性。
引用
@article{arxiv.2605.20271,
title = {Multi-Head Attention as Ensemble Nadaraya-Watson Estimation: Variance Reduction, Decorrelation, and Optimal Head Diversity},
author = {Ernest Fokoué},
journal= {arXiv preprint arXiv:2605.20271},
year = {2026}
}
备注
14 pages