中文

Mamba-3:基于状态空间原理的改进序列建模

机器学习 2026-03-17 v1

摘要

推理时间计算的规模化已成为 LLM 性能的重要驱动力,使得推理效率成为模型设计的核心关注点,这与模型质量并行。虽然当前基于 Transformer 的模型在模型质量方面表现优异,但其二次计算和线性内存使推理成本高昂。这催生了亚二次模型的开发,这些模型具有降低的线性计算和常数内存要求。然而,许多最近的线性模型在牺牲模型质量和能力以换取算法效率方面进行权衡,在诸如状态跟踪等任务上表现不佳。此外,它们在理论上保持线性推理时,在实际操作中却不够高效。以推理为导向的视角引导下,我们引入了三个核心方法ological 改进,这些改进灵感来自线性模型的状态空间模型(SSM)观点。我们结合:(1)源自 SSM 离散化的更具表达力的递归,(2)启用更丰富状态跟踪的复数价状态更新规则,(3)用于在不增加解码延迟的前提下提升模型性能的多输入多输出(MIMO)公式。除了架构细化之外,我们的 Mamba-3 模型在检索、状态跟踪和下游语言建模任务中实现了显著提升。在 15B 参数规模下,Mamba-3 在下游准确率方面比下一个最佳模型(Gated DeltaNet)提升了 0.6 个百分点,Mamba-3 的 MIMO 变体进一步提升 1.2 个百分点,总计提升 1.8 个百分点。在状态大小实验中,Mamba-3 尽管使用其前身的一半状态大小,却实现了与 Mamba-2 相当的 perplexity。我们的评估表明,Mamba-3 能够推动性能-效率 Pareto 前沿的 advance。

关键词

引用

@article{arxiv.2603.15569,
  title  = {Mamba-3: Improved Sequence Modeling using State Space Principles},
  author = {Aakash Lahoti and Kevin Y. Li and Berlin Chen and Caitlin Wang and Aviv Bick and J. Zico Kolter and Tri Dao and Albert Gu},
  journal= {arXiv preprint arXiv:2603.15569},
  year   = {2026}
}

备注

ICLR 2026