中文

Delta注意力残差

机器学习 2026-05-20 v1 计算机视觉与模式识别

摘要

注意力残差通过对前一层输出进行学习softmax注意力,实现选择性跨层路由。然而,标准注意力残差仍注意力累积的隐藏状态,这些状态高度冗余。我们表明,这种冗余导致更深层的路由崩溃:注意力权重分布低对比度,趋向均匀(最大权重≈0.2),限制了模型选择前一层信息状态的能力。这引出一个关键但未被充分探讨的设计问题:在注意力残差中应路由何种层级表示?为回答此问题,我们提出Delta注意力残差,采用每个子层引入的变化量(vi=hi+1hi\mathbf{v}_i = \mathbf{h}_{i+1} - \mathbf{h}_i)进行注意力,而非累积状态。Delta表示结构多样,产生更高对比度的注意力分布(最大权重≈0.6),实现跨层更具选择性和有效性的路由。该原则适用于子层与块级粒度。在所有测试规模(220M~7.6B)中,Delta注意力残差均优于标准残差与注意力残差,实现1.7%~8.2%的验证困惑度提升。Delta注意力残差亦可通过标准微调将预训练检查点转换为Delta注意力残差。代码已公开于https://github.com/wdlctc/delta-attention-residuals-code。

关键词

引用

@article{arxiv.2605.18855,
  title  = {Delta Attention Residuals},
  author = {Cheng Luo and Zefan Cai and Junjie Hu},
  journal= {arXiv preprint arXiv:2605.18855},
  year   = {2026}
}