GLM:基于自回归空白填充的通用语言模型预训练
计算与语言
2022-03-18 v2 人工智能
机器学习
摘要
已有多种类型的预训练架构,包括自编码模型(如 BERT)、自回归模型(如 GPT)以及编码器-解码器模型(如 T5)。然而,对于自然语言理解(NLU)、无条件生成和条件生成这三类主要任务,没有一种预训练框架能在所有任务上都取得最佳表现。我们提出了一种基于自回归空白填充的通用语言模型(GLM)来应对这一挑战。GLM 通过加入二维位置编码并允许以任意顺序预测片段,改进了空白填充预训练,从而在 NLU 任务上取得优于 BERT 和 T5 的性能。同时,GLM 可通过改变空白的数量和长度,针对不同类型的任务进行预训练。在涵盖 NLU、条件生成和无条件生成的广泛任务上,在相同模型规模和数据量下,GLM 优于 BERT、T5 和 GPT,并且以仅含 BERT Large 1.25 倍参数的单个预训练模型取得了最佳性能,展示了其对不同下游任务的通用性。
引用
@article{arxiv.2103.10360,
title = {GLM: General Language Model Pretraining with Autoregressive Blank Infilling},
author = {Zhengxiao Du and Yujie Qian and Xiao Liu and Ming Ding and Jiezhong Qiu and Zhilin Yang and Jie Tang},
journal= {arXiv preprint arXiv:2103.10360},
year = {2022}
}
备注
to be published in ACL 2022. 16 pages, 4 figures