中文

Gated DeltaNet-2:解耦线性注意力中的擦除与写入

人工智能 2026-05-22 v1

摘要

线性注意力将 softmax 注意力的无界缓存替换为固定大小的循环状态,将序列混合计算复杂度降至线性,解码内存需求降至常数。硬难点不在于忘记什么,而在于如何在不扰乱现有关联的情况下编辑这块压缩记忆。Delta 规则模型在写入当前读取之前抵消当前值,Kimi Delta Attention(KDA)通过通道级衰减来锐化忘记。但主动编辑仍使用单个标量门控两种不同事物:如何在键侧擦除旧内容以及如何在值侧提交新内容。我们引入 Gated DeltaNet-2,该模型概括了 Gated DeltaNet 和 KDA,继承了自适应忘记和通道级衰减,同时解决了它们共享的局限性——即擦除与写入之间的标量绑定。Gated Delta Rule-2 用一个通道级擦除门 btb_t 和一个通道级写入门 wtw_t 分离这两个角色,在两个门都折叠为相同标量时还原为 KDA,在衰减也折叠时还原为 Gated DeltaNet。我们提出一种快速权重更新视角,一种吸收不对称擦除因子的分块 WY 算法,以及一种保持高效并行训练的门控感知反向传播。以 13 亿参数训练 1000 亿 FineWeb-Edu token,Gated DeltaNet-2 在语言建模、常识推理和检索任务中均取得 Mamba-2、Gated DeltaNet、KDA 和 Mamba-3 变体的最强综合结果。其优势在长上下文 RULER needle-in-a-haystack 基准中尤为显著,改进了评估的多键检索设置,并在 recurrent 和 hybrid 设置中同样表现强劲。代码已公开于 https://github.com/NVlabs/GatedDeltaNet-2。

关键词

引用

@article{arxiv.2605.22791,
  title  = {Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention},
  author = {Ali Hatamizadeh and Yejin Choi and Jan Kautz},
  journal= {arXiv preprint arXiv:2605.22791},
  year   = {2026}
}

备注

Gated DeltaNet-2 technical report; code at https://github.com/NVlabs/GatedDeltaNet-2