中文

Kaczmarz 线性注意力

机器学习 2026-05-12 v1 人工智能

摘要

长上下文语言建模仍是现代序列建模的核心,但 Transformer 注意力的二次计算成本使得扩规模在计算上不可行。线性循环模型通过压缩上下文至固定大小的状态来解决这一瓶颈,使得忘记、写入和编辑信息的规则成为核心设计问题。為解决狀態維護問題,Gated DeltaNet (GDN) 將門控狀態衰減與 delta-rule 殘差寫入相結合,使用可學的系數在忘記與更新幅度之間進行平衡。然而,這個系數是通過經驋學習而非來自底層目標推導,可能導致次優的更新幅度。我們重新檢視支撐 GDN 的線性回歸目標,並以 Kaczmarz 投影方法為靈感,推導出關鍵-范數正規化的動動態步長 βt=ηt/(kt22+ϵ)\beta_t = \eta_t / (\|k_t\|_2^2 + \epsilon) 用於殘差更新。我們提出了 Kaczmarz 线性注意力 (KLA),是 GDN 的一個單標量修改,保留狀態形狀、門控、线性循環和分塊並行算法。於是,在 0.4B 模型規模且 1B token 預算下,KLA 在評估的各種线性時間基線中達到最低驗證 perplexity,8.09 與 GDN 的 8.50 相較,並能穩定運行至 65K tokens。在受控任務上,KLA 在單根針在草叢中檢索中達到 100%,將 8 倍多查詢類比記憶提升 7.03 分超過 GDN,並在 32K 上下文時提供 2.1 倍的解碼吞吐量。這些結果表明,關鍵-范數正規化的 Kaczmarz 系數是 delta-rule 序列模型的第一級設計軸:它在不改變循環狀態或硬件核心的情況下,提升了準確度、外推能力和解碼效率。

关键词

引用

@article{arxiv.2605.08587,
  title  = {Kaczmarz Linear Attention},
  author = {Jiaxuan Zou and Ruifeng Ren and Yong Liu},
  journal= {arXiv preprint arXiv:2605.08587},
  year   = {2026}
}