中文

从马尔可夫到拉普拉斯:Mamba 类内学习马尔可夫链

机器学习 2025-02-17 v1 人工智能 信息论 math.IT

摘要

虽然基于 transformer 的语言模型推动了人工智能的革命,但其计算复杂度已引发对可行替代方案的日益关注,如结构化状态空间序列模型 (SSM) 和选择性 SSM。其中,Mamba (S6) 及其变体 Mamba-2 在 transformer 推理速度上取得了显著提升,同时在复杂语言建模任务中实现了与 transformer 相当或更好的性能。然而,尽管存在这些架构创新和实证成功,Mamba 的基本学习能力仍知之�少。本文通过研究马尔可夫链上的类内学习 (ICL),揭示了一个惊人现象:与 transformer 不同,甚至一个单层的 Mamba 能够高效学习马尔可夫链的所有阶数的类内拉普拉斯平滑估计器,而该估计器既是贝叶斯最优又是小误差界 (minimax) 最优。为解释这一现象,我们理论地表征了 Mamba 的表示能力,揭示了卷积在使其能够表示最优拉普拉斯平滑中起到的根本作用。这些理论洞察与实证结果高度吻合,并鉴于本文在知识中,代表着 Mamba 与最优统计估计器之间首次正式联系。最后,我们概述了由这些发现启发的有前景的研究方向。

关键词

引用

@article{arxiv.2502.10178,
  title  = {From Markov to Laplace: How Mamba In-Context Learns Markov Chains},
  author = {Marco Bondaschi and Nived Rajaraman and Xiuying Wei and Kannan Ramchandran and Razvan Pascanu and Caglar Gulcehre and Michael Gastpar and Ashok Vardhan Makkuva},
  journal= {arXiv preprint arXiv:2502.10178},
  year   = {2025}
}