中文

ERNIE 3.0 Titan:探索更大规模知识增强预训练用于语言理解与生成

计算与语言 2021-12-24 v1

摘要

预训练语言模型已在各种自然语言处理(NLP)任务中取得最先进的结果。GPT-3 已表明扩大预训练语言模型规模可进一步挖掘其巨大潜力。近期提出了一个名为 ERNIE 3.0 的统一框架用于预训练大规模知识增强模型,并训练了具有 100 亿参数的模型。ERNIE 3.0 在各种 NLP 任务上优于最先进模型。为探索扩大 ERNIE 3.0 规模后的性能,我们在 PaddlePaddle 平台上训练了一个名为 ERNIE 3.0 Titan 的千亿参数模型,参数规模高达 2600 亿。此外,我们设计了一种自监督对抗损失和可控语言建模损失,使 ERNIE 3.0 Titan 生成可信且可控的文本。为降低计算开销与碳排放,我们提出了一种用于 ERNIE 3.0 Titan 的在线蒸馏框架,其中教师模型同时教导学生并训练自身。ERNIE 3.0 Titan 是迄今最大的中文稠密预训练模型。实证结果表明,ERNIE 3.0 Titan 在 68 个 NLP 数据集上优于最先进模型。

关键词

引用

@article{arxiv.2112.12731,
  title  = {ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation},
  author = {Shuohuan Wang and Yu Sun and Yang Xiang and Zhihua Wu and Siyu Ding and Weibao Gong and Shikun Feng and Junyuan Shang and Yanbin Zhao and Chao Pang and Jiaxiang Liu and Xuyi Chen and Yuxiang Lu and Weixin Liu and Xi Wang and Yangfan Bai and Qiuliang Chen and Li Zhao and Shiyong Li and Peng Sun and Dianhai Yu and Yanjun Ma and Hao Tian and Hua Wu and Tian Wu and Wei Zeng and Ge Li and Wen Gao and Haifeng Wang},
  journal= {arXiv preprint arXiv:2112.12731},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2107.02137