中文

GLM:基于自回归空白填充的通用语言模型预训练

计算与语言 2022-03-18 v2 人工智能 机器学习

摘要

已有多种类型的预训练架构,包括自编码模型(如 BERT)、自回归模型(如 GPT)以及编码器-解码器模型(如 T5)。然而,对于自然语言理解(NLU)、无条件生成和条件生成这三类主要任务,没有一种预训练框架能在所有任务上都取得最佳表现。我们提出了一种基于自回归空白填充的通用语言模型(GLM)来应对这一挑战。GLM 通过加入二维位置编码并允许以任意顺序预测片段,改进了空白填充预训练,从而在 NLU 任务上取得优于 BERT 和 T5 的性能。同时,GLM 可通过改变空白的数量和长度,针对不同类型的任务进行预训练。在涵盖 NLU、条件生成和无条件生成的广泛任务上,在相同模型规模和数据量下,GLM 优于 BERT、T5 和 GPT,并且以仅含 BERT Large 1.25 倍参数的单个预训练模型取得了最佳性能,展示了其对不同下游任务的通用性。

关键词

引用

@article{arxiv.2103.10360,
  title  = {GLM: General Language Model Pretraining with Autoregressive Blank Infilling},
  author = {Zhengxiao Du and Yujie Qian and Xiao Liu and Ming Ding and Jiezhong Qiu and Zhilin Yang and Jie Tang},
  journal= {arXiv preprint arXiv:2103.10360},
  year   = {2022}
}

备注

to be published in ACL 2022. 16 pages, 4 figures