中文

回声状态变换器:有限记忆上的注意力机制

机器学习 2026-02-09 v3 人工智能

摘要

尽管大语言模型及其底层 Transformer 架构非常高效,但它们并未反映我们大脑如何处理和学习语言等多样化的认知任务,也未反映其如何利用工作记忆。此外,Transformer 面临一个计算限制:复杂度随序列长度呈二次增长。受这些限制的启发,我们旨在设计利用高效工作记忆动态来克服标准计算障碍的架构。我们引入了回声状态变换器(EST),这是一种混合架构,解决了这一挑战,同时在分类和检测任务中展示了最先进的性能。EST 将 Transformer 注意力机制与来自储层计算的节点相结合,创建了一个固定大小的记忆系统。受回声状态网络的启发,我们的方法利用多个并行储层(随机循环网络)作为轻量级且高效的工作记忆。这些独立单元具有独特且学习到的内部动态,并带有自适应泄漏率,使它们能够动态调整自身的时间性。通过将注意力应用于这些固定数量的单元而非输入令牌,EST 实现了整个序列的线性复杂度,有效打破了标准 Transformer 的二次缩放问题。我们在最新的时间序列基准测试——时间序列库(包含五个类别的 69 个任务)上评估了 EST。结果表明,EST 在五个类别中的两个类别中总体排名第一,在分类和异常检测任务上优于强大的最先进基线,同时在短期预测上保持竞争力。这些结果表明,通过将注意力机制从整个输入序列转移到一组固定的演化记忆单元,可以在保持对时间事件高敏感性的同时,实现每步恒定的计算复杂度。

关键词

引用

@article{arxiv.2507.02917,
  title  = {Echo State Transformer: Attention Over Finite Memories},
  author = {Yannis Bendi-Ouis and Xavier Hinaut},
  journal= {arXiv preprint arXiv:2507.02917},
  year   = {2026}
}