FG²-GDN:通过双精细控制增强长上下文门控 Delta 网络
机器学习
2026-05-05 v2
摘要
线性注意力机制已成为softmax注意力的有前景替代方案,推理期间具有线性时间复杂度。最近的进展,如Gated DeltaNet (GDN)和Kimi Delta Attention (KDA),已显示出delta规则(一种在线梯度下降更新)相对于简单加法更新在关联记忆方面具有优势。虽然KDA将粗糙的head级衰减门 refined 为channel级衰减,但delta更新中的学习率 仍为标量,限制了模型在维度特定适应方面的容量。我们引入FG²-GDN,将标量 替换为类似于从SGD过渡到AdaGrad和Adam等按坐标自适应优化器的channel级向量。我们进一步提出FG²-GDN+,解耦key和value的缩放,实现对擦除强度和写入强度的独立控制。在合成和真实世界基准测试中的实验表明,FG²-GDN及其变体在GDN和KDA之上改善了关联记忆和长上下文理解,同时保持了可比较的计算效率。
引用
@article{arxiv.2604.19021,
title = {FG$^2$-GDN: Enhancing Long-Context Gated Delta Networks with Doubly Fine-Grained Control},
author = {Pingwei Sun and Yuxuan Hu and Jianchao Tan and Xue Wang and Jiaqi Zhang and Yifan Lu and Yerui Sun and Yuchen Xie and Xunliang Cai},
journal= {arXiv preprint arXiv:2604.19021},
year = {2026}
}