中文

MDN:步进动量的分块并行 Delta Linear 注意力

机器学习 2026-05-08 v1 神经与进化计算

摘要

线性注意力(LA)为扩展大型语言模型(LLM)到长序列提供了一种有前景的范式,避免了自注意力的二次复杂度。最近的LA模型如Mamba2和GDN将线性递推解释为闭形式的在线随机梯度下降(SGD),但朴素的SGD更新在信息衰减和优化收敛性方面存在问题。虽然动量基优化器提供了一种自然的解决方案,但在同时实现训练效率和有效性方面仍面临挑战。为此,我们开发了一种基于树的分块划分问题的多项式时间加法逼近方案,以实现在常数速率 regime下的速率约束情况。我们的工作为近似最优的二进逼近提供了可验证的保证,并构成了一个原则性的框架用于LLM-based 隐写术,其中速率映射到每token隐藏信息的位数,总变差界控制统计检测可见性。

关键词

引用

@article{arxiv.2605.05838,
  title  = {MDN: Parallelizing Stepwise Momentum for Delta Linear Attention},
  author = {Yulong Huang and Xiang Liu and Hongxiang Huang and Xiaopeng Lin and Zunchang Liu and Xiaowen Chu and Zeke Xie and Bojun Cheng},
  journal= {arXiv preprint arXiv:2605.05838},
  year   = {2026}
}