中文

MoE-Mamba:结合专家混合的高效选择性状态空间模型

机器学习 2024-02-27 v2 人工智能 计算与语言

摘要

状态空间模型(SSM)已成为序列建模领域的有力竞争者,挑战着Transformer的主导地位。与此同时,专家混合(MoE)显著改进了基于Transformer的大型语言模型,包括近期最先进的开放模型。我们提出,为释放SSM的扩展潜力,应将其与MoE相结合。我们在Mamba(一个近期取得显著性能的基于SSM的模型)上展示了这一点。我们的模型MoE-Mamba在性能上超越了Mamba和基线Transformer-MoE。特别是,MoE-Mamba在训练步数减少2.352.35倍的情况下达到了与Mamba相同的性能,同时保持了Mamba相对于Transformer的推理性能优势。

关键词

引用

@article{arxiv.2401.04081,
  title  = {MoE-Mamba: Efficient Selective State Space Models with Mixture of Experts},
  author = {Maciej Pióro and Kamil Ciebiera and Krystian Król and Jan Ludziejewski and Michał Krutul and Jakub Krajewski and Szymon Antoniak and Piotr Miłoś and Marek Cygan and Sebastian Jaszczur},
  journal= {arXiv preprint arXiv:2401.04081},
  year   = {2024}
}