中文

使用自编码器刻画 Mamba 的选择性记忆

计算与语言 2025-12-18 v1

摘要

状态空间模型(SSM)因在推理期间使用固定内存而成为变换器语言建模的有前景的替代方案。然而,这种固定内存使用需要在处理长序列时在隐藏状态中发生一些信息损失。虽然已有研究考察了这种信息损失发生的序列长度,但尚未对 SSM 语言模型(LM)倾向于遗忘的类型信息进行刻画。本文通过识别 SSM LM 更常遗忘的 token 类型(例如词性、命名实体)和序列类型(例如代码、数学问题),来填补这一知识空白。我们通过训练自编码器从 SSM 的隐藏状态重建序列,并通过比较输入与其重建之间的差异来衡量信息损失。我们使用 Mamba 系列 SSM LM(规模从 1.3 亿至 14 亿)进行实验,序列长度从 4 个 token 到 256 个 token 不等。我们的结果表明,数学相关 token(如数字、变量)、组织实体提及以及非标准美式英语的其他方言的遗忘率显著更高。随后我们检查了这些 token 在 Mamba 预训练数据中的出现频率,发现较不常见的 token tends to 是 Mamba 最可能遗忘的。通过识别这些模式,我们的工作为开发更好控制 Mamba 保留重要信息的 метод提供了明确指导。

关键词

引用

@article{arxiv.2512.15653,
  title  = {Characterizing Mamba's Selective Memory using Auto-Encoders},
  author = {Tamanna Hossain and Robert L. Logan and Ganesh Jagadeesan and Sameer Singh and Joel Tetreault and Alejandro Jaimes},
  journal= {arXiv preprint arXiv:2512.15653},
  year   = {2025}
}

备注

AACL 2025. Oral Presentation