中文

Forgetting Transformer:带有遗忘门的 Softmax 注意力

机器学习 2025-04-02 v2 人工智能 计算与语言

摘要

现代循环序列模型的一个基本组件是遗忘门。虽然 Transformer 没有显式的循环形式,但我们表明,通过以数据相关的方式降低未归一化注意力分数的权重,可以将遗忘门自然地整合到 Transformer 中。我们将这种注意力机制命名为 Forgetting Attention,并将由此产生的模型命名为 Forgetting Transformer (FoX)。我们表明,FoX 在长上下文语言建模、长度外推和短上下文下游任务上优于 Transformer,同时在长上下文下游任务上与 Transformer 表现相当。此外,它与 FlashAttention 算法兼容,且不需要任何位置嵌入。包括大海捞针测试在内的几项分析表明,与 Mamba-2、HGRN2 和 DeltaNet 等循环序列模型相比,FoX 也保留了 Transformer 卓越的长上下文能力。我们还引入了一种“Pro”块设计,该设计整合了循环序列模型中的一些常见架构组件,并发现它能显著提升 FoX 和 Transformer 的性能。我们的代码可在 https://github.com/zhixuan-lin/forgetting-transformer 获取。

关键词

引用

@article{arxiv.2503.02130,
  title  = {Forgetting Transformer: Softmax Attention with a Forget Gate},
  author = {Zhixuan Lin and Evgenii Nikishin and Xu Owen He and Aaron Courville},
  journal= {arXiv preprint arXiv:2503.02130},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025; Fixed an issue with the attention map visualization