从稀疏到软混合专家
机器学习
2024-05-28 v2 人工智能
计算机视觉与模式识别
摘要
稀疏混合专家架构(MoEs)在不显著增加训练或推理成本的情况下扩展模型容量。尽管取得了成功,MoEs 仍存在若干问题:训练不稳定、token 丢弃、无法扩展专家数量,或微调效果不佳。在本工作中,我们提出 Soft MoE,一种全可微的稀疏 Transformer,在保持 MoEs 优势的同时应对这些挑战。Soft MoE 通过将所有输入 token 的不同加权组合传递给每个专家,执行隐式软分配。如同其他 MoEs,Soft MoE 中的专家仅处理(组合后的)token 的一个子集,从而以更低的推理成本实现更大的模型容量(和性能)。在视觉识别任务中,Soft MoE 大幅优于稠密 Transformer(ViTs)和流行的 MoEs(Tokens Choice 与 Experts Choice)。此外,Soft MoE 扩展性良好:具有 16 个 MoE 层中 128 个专家的 Soft MoE Huge/14 参数量超过 ViT Huge/14 的 40 倍,推理时间仅增加 2%,且质量显著更优。
引用
@article{arxiv.2308.00951,
title = {From Sparse to Soft Mixtures of Experts},
author = {Joan Puigcerver and Carlos Riquelme and Basil Mustafa and Neil Houlsby},
journal= {arXiv preprint arXiv:2308.00951},
year = {2024}
}
备注
Published as a conference paper at ICLR 2024