中文

ST-MoE:设计稳定且可迁移的稀疏专家模型

计算与语言 2022-05-03 v2 机器学习

摘要

规模在自然语言处理中开辟了新前沿——但代价高昂。作为回应,专家混合 (Mixture-of-Experts, MoE) 和 Switch Transformers 被提出作为通往更大且更强语言模型的节能路径。但在广泛的自然语言任务上推进最先进水平一直受到微调期间训练不稳定性和质量不确定性的阻碍。我们的工作聚焦于这些问题并充当设计指南。我们最终将稀疏模型扩展到 269B 参数,其计算成本与 32B 稠密编码器-解码器 Transformer(稳定且可迁移的专家混合,即 ST-MoE-32B)相当。稀疏模型首次在迁移学习中取得最先进性能,涵盖多种不同任务,包括推理(SuperGLUE、ARC Easy、ARC Challenge)、摘要(XSum、CNN-DM)、闭卷问答(WebQA、Natural Questions)以及对抗性构建的任务(Winogrande、ANLI R3)。

关键词

引用

@article{arxiv.2202.08906,
  title  = {ST-MoE: Designing Stable and Transferable Sparse Expert Models},
  author = {Barret Zoph and Irwan Bello and Sameer Kumar and Nan Du and Yanping Huang and Jeff Dean and Noam Shazeer and William Fedus},
  journal= {arXiv preprint arXiv:2202.08906},
  year   = {2022}
}

备注

25 pages main text, 39 pages overall