preconditioned DeltaNet:面向线性递推的曲率感知序列建模
机器学习
2026-04-24 v1
摘要
为解决 softmax 注意力在处理长上下文时的计算限制问题,本文发展了几种亚二次递归算子,包括 Mamba-2、DeltaNet、Gated DeltaNet (GDN) 和 Kimi Delta Attention (KDA)。随着递归空间的不断扩大,围绕这些模型的分类研究亦呈现出平行发展。其中一种引人注目的视角是测试时回归 (TTR) 框架,它将递归解释为执行在线最小二乘更新,从而学习键值之间的线性映射。现有的 delta 规则递归可视为对这一目标的一次一阶近似,但显著忽略了最小二乘损失在优化过程中的曲率。在本文中,我们通过引入 preconditioning 来解决这一问题。首先,基于在线最小二乘理论,推导了线性注意力与 delta 规则在完全 preconditioned 情况下的等价性。随后,我们在实践中实现了该理论,通过提出一种对角近似,引入了 DeltaNet、GDN 和 KDA 的 preconditioned 变体,并设计了高效的块状并行算法进行计算。实验结果表明,我们的 preconditioned delta 规则递归在合成回忆基准和 340M 和 1B 模型规模下的语言建模任务中均表现出一致的性能提升。
引用
@article{arxiv.2604.21100,
title = {Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences},
author = {Neehal Tumma and Noel Loo and Daniela Rus},
journal= {arXiv preprint arXiv:2604.21100},
year = {2026}
}