中文

CPM:一个大规模生成式中文预训练语言模型

计算与语言 2020-12-02 v1

摘要

预训练语言模型(PLMs)已被证明有益于各种下游自然语言处理(NLP)任务。近来,拥有1750亿参数和570GB训练数据的GPT-3因具备少样本(甚至零样本)学习能力而备受关注。然而,由于GPT-3的训练语料主要为英文且其参数未公开,将其应用于解决中文NLP任务仍具挑战。在本技术报告中,我们发布了中文预训练语言模型(CPM),该模型在大规模中文训练数据上进行了生成式预训练。据我们所知,CPM拥有26亿参数和100GB中文训练数据,是最大的中文预训练语言模型,可助力对话、文章生成、完形填空和语言理解等多项下游中文NLP任务。大量实验表明,CPM在少样本(甚至零样本)学习设定下于诸多NLP任务上取得了强劲性能。代码与参数可在 https://github.com/TsinghuaAI/CPM-Generate 获取。

关键词

引用

@article{arxiv.2012.00413,
  title  = {CPM: A Large-scale Generative Chinese Pre-trained Language Model},
  author = {Zhengyan Zhang and Xu Han and Hao Zhou and Pei Ke and Yuxian Gu and Deming Ye and Yujia Qin and Yusheng Su and Haozhe Ji and Jian Guan and Fanchao Qi and Xiaozhi Wang and Yanan Zheng and Guoyang Zeng and Huanqi Cao and Shengqi Chen and Daixuan Li and Zhenbo Sun and Zhiyuan Liu and Minlie Huang and Wentao Han and Jie Tang and Juanzi Li and Xiaoyan Zhu and Maosong Sun},
  journal= {arXiv preprint arXiv:2012.00413},
  year   = {2020}
}