中文

剖析线性循环模型:不同门控策略如何驱动选择性与泛化

机器学习 2026-01-21 v1 计算与语言

摘要

线性循环神经网络因其高度可并行化的训练以及推理时恒定的内存和计算需求,已成为原始 Transformer 的 softmax 注意力机制的高效替代方案。这些模型的迭代改进引入了越来越多的架构机制,导致复杂性和计算成本增加。然而,这些模型之间的系统性直接比较仍然有限。现有的基准任务要么过于简单而无法揭示实质性差异,要么过于消耗资源而难以进行实验。在这项工作中,我们提出了一个精细化的线性循环模型分类法,并引入了 SelectivBench,这是一组轻量级且可定制的合成基准任务,用于系统评估序列模型。SelectivBench 专门评估中小规模序列模型的选择性,例如关注相关输入而忽略基于上下文的干扰项的能力。它采用基于规则的语法来生成具有可调复杂度的序列,其中包含故意违反转移规则的不规则间隔。在 SelectivBench 上对线性循环模型的评估揭示了与大规模语言任务结果一致的性能模式。我们的分析阐明了关键架构特征的作用:门控和快速遗忘机制促进召回,状态内通道混合对于选择性不是必需的,但对泛化至关重要,而 softmax 注意力因其内存容量随序列长度扩展而保持主导地位。我们的基准测试能够对线性循环模型进行有针对性的高效探索,并为研究大规模评估中观察到的行为提供了一个受控环境。代码可在 https://github.com/symseqbench/selectivbench 获取。

关键词

引用

@article{arxiv.2601.12598,
  title  = {Dissecting Linear Recurrent Models: How Different Gating Strategies Drive Selectivity and Generalization},
  author = {Younes Bouhadjar and Maxime Fabre and Felix Schmidt and Emre Neftci},
  journal= {arXiv preprint arXiv:2601.12598},
  year   = {2026}
}

备注

11 pages, 4 figures and 4 tables