中文

PanGu-{\Sigma}:面向稀疏异构计算的万亿参数语言模型

计算与语言 2023-03-21 v1

摘要

大语言模型的规模化极大提升了自然语言理解、生成与推理能力。本工作中,我们开发了一个在 Ascend 910 AI 处理器集群和 MindSpore 框架上训练万亿参数语言模型的系统,并提出了拥有 1.085T 参数的语言模型 PanGu-{\Sigma}。该模型参数继承自 PanGu-{\alpha},我们将稠密 Transformer 模型扩展为带有随机路由专家(RRE)的稀疏模型,并通过专家计算与存储分离(ECSS)在 329B tokens 上高效训练。这通过异构计算使训练吞吐量提升 6.3 倍。我们的实验结果表明,PanGu-{\Sigma} 在各类中文 NLP 下游任务的零样本学习中提供最优性能。此外,其在开放域对话、问答、机器翻译和代码生成的应用数据上微调时展现出强大能力。

关键词

引用

@article{arxiv.2303.10845,
  title  = {PanGu-{\Sigma}: Towards Trillion Parameter Language Model with Sparse Heterogeneous Computing},
  author = {Xiaozhe Ren and Pingyi Zhou and Xinfan Meng and Xinjing Huang and Yadao Wang and Weichao Wang and Pengfei Li and Xiaoda Zhang and Alexander Podolskiy and Grigory Arshinov and Andrey Bout and Irina Piontkovskaya and Jiansheng Wei and Xin Jiang and Teng Su and Qun Liu and Jun Yao},
  journal= {arXiv preprint arXiv:2303.10845},
  year   = {2023}
}