XMoE: 具有细粒度与自适应专家选择的稀疏模型
机器学习
2024-05-27 v2 计算与语言
摘要
包括稀疏混合专家 (MoE) 模型在内的稀疏模型,已成为扩展 Transformer 模型的有效方法。然而,它们经常面临计算效率低下的问题,因为大量参数通过将值乘以零或低激活值而不必要地参与了计算。为了解决这个问题,我们提出了 \tool,一种旨在同时提高稀疏 MoE 模型有效性与效率的新型 MoE。\tool 利用小专家和基于阈值的路由器,使 token 能够选择性地仅参与必要的参数。我们在语言建模和机器翻译任务上的大量实验表明,\tool 能够在不牺牲性能的情况下,将 MoE 层的计算负载降低 50% 以上,同时提升模型性能。此外,我们通过将 \tool 应用于稠密模型,展示了其通用性,从而在推理期间实现稀疏计算。我们提供了全面的分析,并在 https://github.com/ysngki/XMoE 上公开了我们的代码。
关键词
引用
@article{arxiv.2403.18926,
title = {XMoE: Sparse Models with Fine-grained and Adaptive Expert Selection},
author = {Yuanhang Yang and Shiyi Qi and Wenchao Gu and Chaozheng Wang and Cuiyun Gao and Zenglin Xu},
journal= {arXiv preprint arXiv:2403.18926},
year = {2024}
}
备注
ACL2024 Findings