中文

解析差分 Transformer 解构预训练自注意力机制

机器学习 2025-10-22 v3

摘要

差分 Transformer 近期因其惊人的经验性能而引起广泛关注,常被归因于其能够实现噪声抵消注意力。然而,差分注意力如何实现其经验性收益仍然鲜有人知。此外,差分 Transformer 架构需要从头进行大规模训练,阻碍了使用开放预训练权重的利用。在本工作中,我们对差分 Transformer 进行深入调查,发现其成功的三个关键因素:(1) 通过负注意力实现表达力增强,(2) 注意力头之间的冗余性降低,(3) 学习动力学得到改善。基于这些发现,我们提出了 DEX 方法,高效地将差分注意力的优势整合到预训练语言模型中。通过复用 softmax 注意力得分,并在输出值矩阵上添加轻量级差分操作,DEX 有效地整合了差分注意力的关键优势,同时在训练和推理方面保持轻量级。评估结果表明,DEX 在多样化基准测试中显著提升了预训练大语言模型的性能,在最小化适应数据(<0.01%)的情况下实现了显著的性能提升。

关键词

引用

@article{arxiv.2505.16333,
  title  = {Understanding Differential Transformer Unchains Pretrained Self-Attentions},
  author = {Chaerin Kong and Jiho Jang and Nojun Kwak},
  journal= {arXiv preprint arXiv:2505.16333},
  year   = {2025}
}

备注

NeurIPS 2025