中文

GLaM:利用混合专家高效扩展语言模型

计算与语言 2022-08-03 v2

摘要

以更多数据、算力和参数扩展语言模型推动了自然语言处理的显著进展。例如,得益于扩展,GPT-3 能够在上下文学习任务上取得强劲结果。然而,训练这些大型稠密模型需要大量的计算资源。在本文中,我们提出并开发了一系列名为 GLaM(Generalist Language Model,通才语言模型)的语言模型,其采用稀疏激活的混合专家(mixture-of-experts)架构来扩展模型容量,同时与稠密变体相比大幅降低了训练成本。最大的 GLaM 具有 1.2 万亿参数,约为 GPT-3 的 7 倍。它仅消耗训练 GPT-3 所用能量的 1/3,且推理所需计算 flops 为其一半,同时在 29 项 NLP 任务上仍取得了更好的整体零样本与单样本性能。

关键词

引用

@article{arxiv.2112.06905,
  title  = {GLaM: Efficient Scaling of Language Models with Mixture-of-Experts},
  author = {Nan Du and Yanping Huang and Andrew M. Dai and Simon Tong and Dmitry Lepikhin and Yuanzhong Xu and Maxim Krikun and Yanqi Zhou and Adams Wei Yu and Orhan Firat and Barret Zoph and Liam Fedus and Maarten Bosma and Zongwei Zhou and Tao Wang and Yu Emma Wang and Kellie Webster and Marie Pellat and Kevin Robinson and Kathleen Meier-Hellstern and Toju Duke and Lucas Dixon and Kun Zhang and Quoc V Le and Yonghui Wu and Zhifeng Chen and Claire Cui},
  journal= {arXiv preprint arXiv:2112.06905},
  year   = {2022}
}

备注

Accepted to ICML 2022