Diff Transformer
计算与语言
2025-04-08 v2 机器学习
摘要
Transformer 在注意力机制中对无关上下文的整体分配过多。本文引入 Diff Transformer,通过放大对相关上下文的注意力同时抵消噪声。具体而言,差分注意力机制将注意力得分计算为两个独立 softmax 注意力图之间的差值。这种减法可抵消噪声,促进稀疏注意力模式的出现。在语言建模实验中,Diff Transformer 在 various 设置下的模型规模和训练标记数扩展方面均优于 Transformer。更值得注意的是,它在实际应用中具有显著优势,包括长上下文建模、关键信息检索、减轻幻觉、情境学习以及降低激活离群值。通过不被无关上下文分散注意力,Diff Transformer 能有效减轻问答和文本摘要中的幻觉问题。在情境学习方面,Diff Transformer 不仅提升准确率,还对顺序置换更具鲁棒性——这一问题长期以来一直是该领域的顽疾。 Diff Transformer 的这些结果将其定位为推动大型语言模型发展的一种高效且有前景的架构。
关键词
引用
@article{arxiv.2410.05258,
title = {Differential Transformer},
author = {Tianzhu Ye and Li Dong and Yuqing Xia and Yutao Sun and Yi Zhu and Gao Huang and Furu Wei},
journal= {arXiv preprint arXiv:2410.05258},
year = {2025}
}
备注
Accepted as an Oral Presentation at ICLR 2025