中文

塞满的 Mamba:超大状态导致无法忘记的困境

计算与语言 2026-01-14 v4 人工智能 机器学习

摘要

近期,像 Mamba 和 RWKV 这样的循环神经网络架构在语言能力方面展现出强大的性能。与基于 Transformer 的模型不同,这些架构将所有上下文信息编码到固定大小的状态中,从而实现了极高的推理效率。然而,这种方法可能导致信息干扰,即不同 token 数据之间发生冲突,导致在超过一定上下文长度后性能下降和输出不连贯。为防止此问题,大多数 RNN 都包含旨在“忘记”早期 token 的机制。本文揭示了 Mamba 基于模型在即使内置忘记机制的情况下,也难以有效忘记早期 token。我们展示了这一问题源于模型在过短的上下文长度上进行训练,使得模型无需学习如何忘记便能表现良好。随后,我们证明了模型学习忘记所需的最小训练长度随状态大小线性增长,5 位数字密码钥的准确检索最大上下文长度随状态大小呈指数增长,这表明模型在忘记开始之后仍保有一些信息。这些发现凸显了当前 RNN 架构的一个关键局限,为改进长上下文建模提供了宝贵见解。我们的工作表明,未来的 RNN 设计必须考虑状态大小、训练长度与忘记机制之间的相互作用,以在长上下文任务中实现稳健性能。

关键词

引用

@article{arxiv.2410.07145,
  title  = {Stuffed Mamba: Oversized States Lead to the Inability to Forget},
  author = {Yingfa Chen and Xinrong Zhang and Shengding Hu and Xu Han and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2410.07145},
  year   = {2026}
}

备注

COLM 2025