中文

Transformer即SSM:通过结构化状态空间对偶性的广义模型与高效算法

机器学习 2024-06-03 v1

摘要

尽管Transformer一直是深度学习在语言建模中取得成功的主要架构,但状态空间模型(SSM),如Mamba,最近被证明在中小规模上可以匹配或超越Transformer。我们表明这些模型家族实际上密切相关,并开发了一个丰富的理论联系框架,将SSM与注意力变体联系起来,通过一个经过充分研究的结构化半可分离矩阵类的各种分解。我们的状态空间对偶性(SSD)框架使我们能够设计一种新的架构(Mamba-2),其核心层是Mamba选择性SSM的改进,速度提高了2-8倍,同时在语言建模方面继续与Transformer竞争。

关键词

引用

@article{arxiv.2405.21060,
  title  = {Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality},
  author = {Tri Dao and Albert Gu},
  journal= {arXiv preprint arXiv:2405.21060},
  year   = {2024}
}

备注

ICML 2024