中文

从稀疏到软混合专家

机器学习 2024-05-28 v2 人工智能 计算机视觉与模式识别

摘要

稀疏混合专家架构(MoEs)在不显著增加训练或推理成本的情况下扩展模型容量。尽管取得了成功,MoEs 仍存在若干问题:训练不稳定、token 丢弃、无法扩展专家数量,或微调效果不佳。在本工作中,我们提出 Soft MoE,一种全可微的稀疏 Transformer,在保持 MoEs 优势的同时应对这些挑战。Soft MoE 通过将所有输入 token 的不同加权组合传递给每个专家,执行隐式软分配。如同其他 MoEs,Soft MoE 中的专家仅处理(组合后的)token 的一个子集,从而以更低的推理成本实现更大的模型容量(和性能)。在视觉识别任务中,Soft MoE 大幅优于稠密 Transformer(ViTs)和流行的 MoEs(Tokens Choice 与 Experts Choice)。此外,Soft MoE 扩展性良好:具有 16 个 MoE 层中 128 个专家的 Soft MoE Huge/14 参数量超过 ViT Huge/14 的 40 倍,推理时间仅增加 2%,且质量显著更优。

关键词

引用

@article{arxiv.2308.00951,
  title  = {From Sparse to Soft Mixtures of Experts},
  author = {Joan Puigcerver and Carlos Riquelme and Basil Mustafa and Neil Houlsby},
  journal= {arXiv preprint arXiv:2308.00951},
  year   = {2024}
}

备注

Published as a conference paper at ICLR 2024