中文

线性递推模型的最优衰减谱

机器学习 2026-04-10 v1 人工智能 计算与语言

摘要

线性递�模型提供线性时间序列处理,但常常表现出次优的长程记忆。我们追溯到衰减谱:对于 N 个通道,随机初始化将最小谱隙折叠到 O(N2)O(N^{-2}),导致亚指数误差 exp(Ω(N/logN))\exp(-\Omega(N/\log N));线性间隔可避免折叠但退化为 exp(O(N/T))\exp(-O(N/\sqrt{T})),在长上下文中实际为代数衰减。我们引入位置适应谱浪峰 (Position-Adaptive Spectral Tapering, PoST),一个无需架构依赖的框架,结合两种机制:(1) 谱重参数化,通过结构强制对数衰减率进行几何等距布局,证明在速率 O(exp(cN/logT))O(\exp(-cN/\log T)) 下达到 minimax 最优;(2) 位置适应缩放,是唯一可消除静态谱尺度不匹配的机制(其中仅有 Nlogt/logTN\log t/\log T 的通道在位置 tt 时有效),通过拉伸谱到实际依赖范围实现,从而将速率锐化到 O(exp(cN/logt))O(\exp(-cN/\log t))。这种缩放本构地诱导分数不变性:冲激响应变为尺度无关,通道在相对时间坐标和绝对时间坐标之间进行插值。PoST 可无额外开销地集成到任何对角线线性递推模型中。我们在 Mamba-2、RWKV-7、Gated DeltaNet、Gated Linear Attention 和 RetNet 上实现。规模为 180M-440M 的预训练显示在零样本语言建模中一致性改进,Mamba-2 在长上下文检索方面 (MQAR 和 NIAH) 获得显著提升,其他架构表现出竞争甚至更好的性能。代码:https://github.com/SiLifen/PoST。

关键词

引用

@article{arxiv.2604.07658,
  title  = {Optimal Decay Spectra for Linear Recurrences},
  author = {Yang Cao},
  journal= {arXiv preprint arXiv:2604.07658},
  year   = {2026}
}