中文

单层注意力中的梯度提升

机器学习 2026-05-05 v2 人工智能

摘要

Transformer 注意力对值计算单个 softmax 加权平均——这是一种无法自我修正误差的单次估计。我们提出了 \emph{梯度提升注意力},它在单层注意力中应用梯度提升的原理:第二次注意力传递,具有其自身的学习投影,关注第一次的预测误差并应用门控修正。在平方重构目标下,该构造映射到 Friedman 的梯度提升机器,每次注意力传递作为基学习器,每个维度的门控作为收缩参数。我们证明,单次 Hopfield 风格的更新会擦除所有与存储模式子空间正交的查询信息,而局部收缩下的进一步迭代可以将同一区域中的不同查询坍缩到同一个不动点。我们还表明,修正传递的独立投影可以恢复 Tukey 的 twicing 共享投影方法无法访问的残差信息。在 WikiText-103 和 OpenWebText 的 10M 标记子集上,梯度提升注意力在测试困惑度上比标准注意力提升了 6.0%6.0\%5.6%5.6\%,在两个基准测试中均优于 Twicing 注意力和参数匹配的更宽基线,其中两轮捕获了大部分收益。我们进一步从理论和实证上表明,该机制需要 Pre-LN 变换器的加性残差结构:在 Post-LN 下,相同架构会使困惑度降低 9.6%9.6\%

关键词

引用

@article{arxiv.2604.03190,
  title  = {Gradient Boosting within a Single Attention Layer},
  author = {Saleh Sargolzaei},
  journal= {arXiv preprint arXiv:2604.03190},
  year   = {2026}
}