线性递推模型的最优衰减谱
机器学习
2026-04-10 v1 人工智能
计算与语言
摘要
线性递�模型提供线性时间序列处理,但常常表现出次优的长程记忆。我们追溯到衰减谱:对于 N 个通道,随机初始化将最小谱隙折叠到 ,导致亚指数误差 ;线性间隔可避免折叠但退化为 ,在长上下文中实际为代数衰减。我们引入位置适应谱浪峰 (Position-Adaptive Spectral Tapering, PoST),一个无需架构依赖的框架,结合两种机制:(1) 谱重参数化,通过结构强制对数衰减率进行几何等距布局,证明在速率 下达到 minimax 最优;(2) 位置适应缩放,是唯一可消除静态谱尺度不匹配的机制(其中仅有 的通道在位置 时有效),通过拉伸谱到实际依赖范围实现,从而将速率锐化到 。这种缩放本构地诱导分数不变性:冲激响应变为尺度无关,通道在相对时间坐标和绝对时间坐标之间进行插值。PoST 可无额外开销地集成到任何对角线线性递推模型中。我们在 Mamba-2、RWKV-7、Gated DeltaNet、Gated Linear Attention 和 RetNet 上实现。规模为 180M-440M 的预训练显示在零样本语言建模中一致性改进,Mamba-2 在长上下文检索方面 (MQAR 和 NIAH) 获得显著提升,其他架构表现出竞争甚至更好的性能。代码:https://github.com/SiLifen/PoST。
引用
@article{arxiv.2604.07658,
title = {Optimal Decay Spectra for Linear Recurrences},
author = {Yang Cao},
journal= {arXiv preprint arXiv:2604.07658},
year = {2026}
}