Mamba 能学会如何学习吗?关于上下文学习任务的比较研究
机器学习
2024-04-26 v2
摘要
状态空间模型(SSMs),如 Mamba (Gu & Dao, 2023),已被提出作为 Transformer 网络在语言建模中的替代方案,它通过引入门控、卷积和依赖于输入的 token 选择来缓解多头注意力的二次开销。尽管 SSMs 表现出极具竞争力的性能,但其上下文学习(ICL)能力——现代语言模型一项无需参数优化即可执行任务的显著涌现特性——与 Transformer 相比仍未得到充分探索。在本研究中,我们评估了 SSMs(重点关注 Mamba)在各种任务上相对于 Transformer 模型的 ICL 性能。我们的结果表明,SSMs 在标准回归 ICL 任务中的表现与 Transformer 相当,而在稀疏奇偶校验学习等任务中优于 Transformer。然而,在涉及非标准检索功能的任务中,SSMs 表现不足。为了解决这些局限性,我们引入了一种混合模型 MambaFormer,它将 Mamba 与注意力块相结合,在它们各自难以胜任的任务上超越了单一模型。我们的研究结果表明,混合架构为增强语言模型的 ICL 提供了有前景的途径。
引用
@article{arxiv.2402.04248,
title = {Can Mamba Learn How to Learn? A Comparative Study on In-Context Learning Tasks},
author = {Jongho Park and Jaeseung Park and Zheyang Xiong and Nayoung Lee and Jaewoong Cho and Samet Oymak and Kangwook Lee and Dimitris Papailiopoulos},
journal= {arXiv preprint arXiv:2402.04248},
year = {2024}
}
备注
Changes in v2: experiments on formal language ICL and explorations of width vs. depth on ICL; code repo available (24 pages, 10 figures)