Forgetting Transformer:带有遗忘门的 Softmax 注意力
机器学习
2025-04-02 v2 人工智能
计算与语言
摘要
现代循环序列模型的一个基本组件是遗忘门。虽然 Transformer 没有显式的循环形式,但我们表明,通过以数据相关的方式降低未归一化注意力分数的权重,可以将遗忘门自然地整合到 Transformer 中。我们将这种注意力机制命名为 Forgetting Attention,并将由此产生的模型命名为 Forgetting Transformer (FoX)。我们表明,FoX 在长上下文语言建模、长度外推和短上下文下游任务上优于 Transformer,同时在长上下文下游任务上与 Transformer 表现相当。此外,它与 FlashAttention 算法兼容,且不需要任何位置嵌入。包括大海捞针测试在内的几项分析表明,与 Mamba-2、HGRN2 和 DeltaNet 等循环序列模型相比,FoX 也保留了 Transformer 卓越的长上下文能力。我们还引入了一种“Pro”块设计,该设计整合了循环序列模型中的一些常见架构组件,并发现它能显著提升 FoX 和 Transformer 的性能。我们的代码可在 https://github.com/zhixuan-lin/forgetting-transformer 获取。
引用
@article{arxiv.2503.02130,
title = {Forgetting Transformer: Softmax Attention with a Forget Gate},
author = {Zhixuan Lin and Evgenii Nikishin and Xu Owen He and Aaron Courville},
journal= {arXiv preprint arXiv:2503.02130},
year = {2025}
}
备注
Published as a conference paper at ICLR 2025; Fixed an issue with the attention map visualization