中文

Sessa:选择性状态空间注意力

机器学习 2026-04-22 v2 人工智能 计算与语言

摘要

现代序列建模主要由两大类方法主导:一种是能够访问任意可见序列元素的Transformer,其自注意力机制;另一种是通过显式递归状态传递信息的结构化状态空间模型。这两种机制在长序列情境下都面临不同限制:当注意力扩散时,单个token的影响会被有效支持范围内的其他元素稀释;而递归状态传递若未主动保留信息,则可能丢失长程敏感性。因此,这两种机制在长序列上下文中保留和选择性检索信息方面都面临挑战。我们提出Sessa,这是一个在递归反馈路径中嵌入注意力机制的解码器。它通过创建许多注意力路径,使过去的token能够影响未来的状态,而不必依赖单一注意力读取或单一递归链。我们证明,在明确假设和匹配 regime 下,Sessa可实现幂律记忆尾 O(β)O(\ell^{-\beta}) ,其中 0<β<10 < \beta < 1 ,其衰减速度慢于相应的Transformer和Mamba风格基线。我们进一步给出一种实现该幂律速率的显式构造。在相同假设下,Sessa是所考虑模型类中唯一实现灵活选择性检索的模型,包括影响随距离不衰减的配置。Consistent with this theoretical advantage, across matched experiments, Sessa achieves the strongest performance on long-context benchmarks while remaining competitive with Transformer and Mamba-style baselines on short-context language modeling。

关键词

引用

@article{arxiv.2604.18580,
  title  = {Sessa: Selective State Space Attention},
  author = {Liubomyr Horbatko},
  journal= {arXiv preprint arXiv:2604.18580},
  year   = {2026}
}

备注

v2: revised abstract for clarity; main results unchanged. Code available at: https://github.com/LibratioAI/sessa