中文

Mamba 能否在带离群点的情况下学习内在上下文?——一种理论泛化分析

机器学习 2025-10-02 v1

摘要

Mamba 模型因其相对于基于Transformer的模型的计算优势而广受关注, 在各种语言任务上实现相当的性能。像Transformer一样,Mamba展现出内在上下文学习(ICL)能力,即无需微调即可基于包含输入-标签对的提示和查询进行新任务预测。尽管其实证成功有限,理论理解仍不充分,主要由于其门控机制引入的非线性。到目前为止,本文是对单层Mamba模型的训练动力学进行首次理论分析——该模型由线性注意力组件和非线性门控层组成,其在未见的二元分类任务上的ICL泛化,即使在提示中包含加性离群点时也如此。我们的分析表明,Mamba利用线性注意力层选择信息丰富的上下文示例,并使用非线性门控层抑制离群点的影响。通过建立并与相同设置下的线性Transformer分析进行比较,我们显示尽管Mamba可能需要更多训练迭代才能收敛,但它在离群点比例超过线性Transformer可容忍阈值的情况下仍保持准确预测。这些理论发现得到实验验证的支持。

关键词

引用

@article{arxiv.2510.00399,
  title  = {Can Mamba Learn In Context with Outliers? A Theoretical Generalization Analysis},
  author = {Hongkang Li and Songtao Lu and Xiaodong Cui and Pin-Yu Chen and Meng Wang},
  journal= {arXiv preprint arXiv:2510.00399},
  year   = {2025}
}