MoE-Mamba:结合专家混合的高效选择性状态空间模型
机器学习
2024-02-27 v2 人工智能
计算与语言
摘要
状态空间模型(SSM)已成为序列建模领域的有力竞争者,挑战着Transformer的主导地位。与此同时,专家混合(MoE)显著改进了基于Transformer的大型语言模型,包括近期最先进的开放模型。我们提出,为释放SSM的扩展潜力,应将其与MoE相结合。我们在Mamba(一个近期取得显著性能的基于SSM的模型)上展示了这一点。我们的模型MoE-Mamba在性能上超越了Mamba和基线Transformer-MoE。特别是,MoE-Mamba在训练步数减少倍的情况下达到了与Mamba相同的性能,同时保持了Mamba相对于Transformer的推理性能优势。
引用
@article{arxiv.2401.04081,
title = {MoE-Mamba: Efficient Selective State Space Models with Mixture of Experts},
author = {Maciej Pióro and Kamil Ciebiera and Krystian Król and Jan Ludziejewski and Michał Krutul and Jakub Krajewski and Szymon Antoniak and Piotr Miłoś and Marek Cygan and Sebastian Jaszczur},
journal= {arXiv preprint arXiv:2401.04081},
year = {2024}
}