Mamba 综述
机器学习
2026-04-07 v8 人工智能
摘要
作为最具代表性的深度学习技术之一,Transformer 架构已赋能众多先进模型,尤其是由数十亿参数构成的大型语言模型(LLM),成为深度学习领域的基石。尽管取得了惊人的成就,Transformer 仍面临固有的局限,尤其是注意力计算的二次计算复杂度导致推理耗时。最近,一种新兴的架构 named Mamba,灵感来自经典的状态空间模型(SSM),作为构建基础模型的有前景的替代方案,能够在保持关于序列长度的近线性可扩展性的同时,实现与 Transformer 相当的建模能力。这引发了越来越多的研究探索 Mamba 在多个领域实现卓越性能的潜力。鉴于其快速的演化,迫切需要一份系统性综述,以整合现有 Mamba 赋能模型,为理解这一新兴模型架构提供全面认识。因此,本综述对近期与 Mamba 相关的研究进行深入调查,涵盖三个主要方面:Mamba 基于模型的进展、适用于不同数据的技术,以及 Mamba 能胜任的应用。具体而言,我们首先综述了各种代表性深度学习模型的基本知识以及 Mamba-1&2 的细节作为预备知识。然后,为展示 Mamba 对人工智能的重要性,我们全面综述了聚焦 Mamba 模型架构设计、数据适应性和应用的相关研究。最后,本文讨论当前的局限性,并探讨各种有前景的研究方向,以为未来调查提供更深入的见解。
引用
@article{arxiv.2408.01129,
title = {A Survey of Mamba},
author = {Haohao Qu and Liangbo Ning and Rui An and Wenqi Fan and Tyler Derr and Hui Liu and Xin Xu and Qing Li},
journal= {arXiv preprint arXiv:2408.01129},
year = {2026}
}
备注
Accepted by ACM Transactions on Intelligent Systems and Technology