中文

MDN:步进动量的分块并行 Delta Linear 注意力

信息论 2026-05-08 v1 数据结构与算法 math.IT

摘要

线性注意力(LA)提供了一种扩展大型语言模型(LLM)到长序列的有前景的范式,通过避免自注意力的二次复杂度。最近的LA模型如Mamba2和GDN将线性递推解释为闭形式的在线随机梯度下降(SGD),但朴素的SGD更新在信息衰减和优化收敛性方面存在问题。虽然动量基优化器提供了一种自然的解决方案,但在同时实现训练效率和有效性方面仍面临挑战。为此,我们开发了一种基于树的分块划分问题的多项式时间加法逼近方案,以实现在常数速率 regime下的速率约束情况。我们的工作为近似最优的二进逼近提供了可验证的保证,并构成了一个原则性的框架用于LLM-based 隐写术,其中速率映射到每token隐藏信息的位数,总变差界控制统计检测可见性。

关键词

引用

@article{arxiv.2605.05837,
  title  = {An Additive Approximation Scheme for Generating Dyadic Codings for the Outputs of an LLM},
  author = {Daniella Bar-Lev and Farzad Farnoud and Ryan Gabrys},
  journal= {arXiv preprint arXiv:2605.05837},
  year   = {2026}
}