中文

ERNIE 3.0:面向语言理解与生成的大规模知识增强预训练

计算与语言 2021-07-06 v1

摘要

预训练模型已在各种自然语言处理(NLP)任务中取得最先进的结果。T5 和 GPT-3 等近期工作表明,扩大预训练语言模型的规模可提升其泛化能力。特别是,具有 1750 亿参数的 GPT-3 模型展现出强大的任务无关零样本/少样本学习能力。尽管取得成功,这些大规模模型仅在纯文本上训练,未引入语言知识和世界知识等知识。此外,大多数大规模模型以自回归方式训练。因此,这类传统微调方法在解决下游语言理解任务时表现出相对较弱的性能。为解决上述问题,我们提出一个名为 ERNIE 3.0 的统一框架,用于预训练大规模知识增强模型。它融合自回归网络与自编码网络,使训练后的模型可通过零样本学习、少样本学习或微调轻松适配自然语言理解与生成任务。我们在由纯文本和大规模知识图谱组成的 4TB 语料上训练了具有 100 亿参数的模型。实证结果表明,该模型在 54 个中文 NLP 任务上优于最先进模型,其英文版本在 SuperGLUE 基准(2021年7月3日)上取得第一,以 +0.8%(90.6% 对 89.8%)超越人类表现。

关键词

引用

@article{arxiv.2107.02137,
  title  = {ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation},
  author = {Yu Sun and Shuohuan Wang and Shikun Feng and Siyu Ding and Chao Pang and Junyuan Shang and Jiaxiang Liu and Xuyi Chen and Yanbin Zhao and Yuxiang Lu and Weixin Liu and Zhihua Wu and Weibao Gong and Jianzhong Liang and Zhizhou Shang and Peng Sun and Wei Liu and Xuan Ouyang and Dianhai Yu and Hao Tian and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2107.02137},
  year   = {2021}
}