中文

短程依赖对 Transformer 不稳定性的影响及分解注意力解决方案

机器学习 2025-05-22 v1

摘要

Transformer 模型在自然语言处理和计算机视觉等多个领域推动了显著进展。其核心组件是自注意力(self-attention, SA)机制,通过建模序列中 token 之间的关系来学习丰富的向量表示。然而,尽管已进行广泛研究,Transformer 仍在训练过程中表现出不稳定——常表现为训练损失的尖峰或发散。本文识别了这种不稳定的一个来源:SA 对捕捉短程依赖的有限能力,尤其是在语言建模等任务中几乎每个 token 都强烈依赖其相邻邻居。这种局限导致 SA 的预 softmax logits 快速增长,破坏训练稳定性。为解决此问题,我们提出将 SA 分解为局部(短程)和全局(长程)注意力头。这种分解注意力(Long Short-attention, LS-attention)缓解了 logits 爆炸,使训练比等效的多头自注意力(MHSA)更为稳定。经验比较显示,LS-attention 将验证困惑率降至另一种方法的近 2/5,仅用 1/20 的 GPU 时间即可达到类似水平。此外,实验表明,LS-attention 在推理延迟方面比最先进的等效 MHSA 实现降低最高 36%。

关键词

引用

@article{arxiv.2505.15548,
  title  = {Short-Range Dependency Effects on Transformer Instability and a Decomposed Attention Solution},
  author = {Suvadeep Hajra},
  journal= {arXiv preprint arXiv:2505.15548},
  year   = {2025}
}