中文

Mamba 具备上下文学习能力吗?

机器学习 2024-04-25 v2

摘要

诸如 GPT-4 等最先进的基础模型在上下文学习(ICL)方面表现出色,这是一种元学习的变体,涉及在神经网络前向传播过程中利用作为模型输入提供的上下文信息来解决任务的习得能力。这种有用的能力是基础模型大规模预训练的副产品。虽然 Transformer 模型目前是 ICL 的最先进技术,但本工作提供了实证证据,表明 Mamba——一种新提出的状态空间模型,在输入序列长度方面比 Transformer 具有更好的扩展性——具有类似的 ICL 能力。我们在涉及简单函数逼近以及更复杂的自然语言处理问题的任务上评估了 Mamba。我们的结果表明,在这两类任务中,Mamba 在 ICL 上的性能与 Transformer 模型非常接近。进一步分析揭示,与 Transformer 一样,Mamba 似乎通过逐步优化其内部表示来解决 ICL 问题。总体而言,我们的工作表明,对于涉及长输入序列的 ICL 任务,Mamba 可以成为 Transformer 的高效替代方案。这是元学习领域一个令人兴奋的发现,并可能使上下文学习的 AutoML 算法(如 TabPFN 或 Optformer)推广到长输入序列。

关键词

引用

@article{arxiv.2402.03170,
  title  = {Is Mamba Capable of In-Context Learning?},
  author = {Riccardo Grazzi and Julien Siems and Simon Schrodi and Thomas Brox and Frank Hutter},
  journal= {arXiv preprint arXiv:2402.03170},
  year   = {2024}
}