中文

注意力陷阱诱导出力陷阱:Transformer 中的大规模激活作为梯度调节器

机器学习 2026-05-07 v2 人工智能

摘要

注意力陷阱和大规模激活是 Transformer 模型中反复出现的且紧密相关的现象。现有的解释主要聚焦于前向传播,但在 pre-norm Transformer 中,较大的残差流范数在前向传播中仅起间接作用,因为子层处理的是归一化后的输入。我们从反向传播的角度研究这种关系。从经验和理论上,我们展示在因果遮蔽条件下,注意力陷阱可引发显著的梯度集中,我们称之为梯度陷阱。由于 RMSNorm 雅可比约等于输入范数的倒数来衰减梯度,大规模激活可被理解为对这种局部梯度压力的自适应调节器。在训练期间,这种解释预测衰减陷阱引发的梯度应会削弱大规模激活。我们通过 V-scale 方法测试了这一预测,该方法调整了价值路径上反向传播的梯度。在 V-scale 模型中,注意力陷阱得以保留,而大规模激活则被抑制。这些结果表明,梯度陷阱是注意力陷阱的反向传播中的对应物,而大规模激活是一种由 RMSNorm 中介的自适应响应,用于衰减由此产生的局部训练压力。我们的代码已发布于 https://anonymous.4open.science/r/GradientSinkCode-B309。

关键词

引用

@article{arxiv.2603.17771,
  title  = {Attention Sinks Induce Gradient Sinks: Massive Activations as Gradient Regulators in Transformers},
  author = {Yihong Chen and Zhouchen Lin and Quanming Yao},
  journal= {arXiv preprint arXiv:2603.17771},
  year   = {2026}
}

备注

29 pages, 14 figures, 7 tables