中文

PanGu-$\alpha$:具有自动并行计算的大规模自回归预训练中文语言模型

计算与语言 2021-04-27 v1

摘要

大规模预训练语言模型(PLMs)已成为自然语言处理(NLP)的新范式。具有数千亿参数(如 GPT-3)的 PLM 已通过少样本上下文学习在自然语言理解与生成上展现出强大性能。本文介绍我们在训练名为 PanGu-α\alpha 的大规模自回归语言模型上的实践,参数规模最高达 2000 亿。PanGu-α\alpha 基于 MindSpore 开发,并在 2048 颗 Ascend 910 AI 处理器组成的集群上训练。训练并行策略基于 MindSpore Auto-parallel 实现,其组合了五种并行维度以将训练任务高效扩展至 2048 处理器,包括数据并行、算子级模型并行、流水线模型并行、优化器模型并行与重计算。为增强 PanGu-α\alpha 的泛化能力,我们从广泛领域收集 1.1TB 高质量中文数据以预训练模型。我们在文本摘要、问答、对话生成等多种场景下实证测试了 PanGu-α\alpha 的生成能力。此外,我们研究了模型规模对广泛中文 NLP 任务上少样本性能的影响。实验结果展示了 PanGu-α\alpha 在少样本或零样本设置下执行各类任务的优越能力。

关键词

引用

@article{arxiv.2104.12369,
  title  = {PanGu-$\alpha$: Large-scale Autoregressive Pretrained Chinese Language Models with Auto-parallel Computation},
  author = {Wei Zeng and Xiaozhe Ren and Teng Su and Hui Wang and Yi Liao and Zhiwei Wang and Xin Jiang and ZhenZhang Yang and Kaisheng Wang and Xiaoda Zhang and Chen Li and Ziyan Gong and Yifan Yao and Xinjing Huang and Jun Wang and Jianfeng Yu and Qi Guo and Yue Yu and Yan Zhang and Jin Wang and Hengtao Tao and Dasen Yan and Zexuan Yi and Fang Peng and Fangqing Jiang and Han Zhang and Lingfeng Deng and Yehong Zhang and Zhe Lin and Chao Zhang and Shaojie Zhang and Mingyue Guo and Shanzhi Gu and Gaojun Fan and Yaowei Wang and Xuefeng Jin and Qun Liu and Yonghong Tian},
  journal= {arXiv preprint arXiv:2104.12369},
  year   = {2021}
}

备注

The technique report for PanGu-$\alpha$