中文

何种语言模型架构与预训练目标最利于零样本泛化?

计算与语言 2022-04-13 v1 机器学习 机器学习

摘要

大型预训练 Transformer 语言模型已展现出零样本泛化能力,即它们能执行多种未经显式训练的任务。然而,最先进模型所用的架构与预训练目标差异显著,且对这些因素的系统性比较有限。本文中,我们提出对建模选择及其对零样本泛化影响的的大规模评估。具体而言,我们关注文本到文本模型,并以三种模型架构(因果/非因果仅解码器与编码器-解码器)进行实验,采用两种不同预训练目标(自回归与掩码语言建模)训练,并在有无多任务提示微调下评估。我们训练了参数量超 50 亿、词元数超 1700 亿的模型,从而提高了结论迁移至更大规模的可能性。实验表明,经纯无监督预训练后,以自回归语言建模目标训练的因果仅解码器模型展现出最强的零样本泛化。然而,以掩码语言建模目标训练、再经多任务微调的具有非因果输入可见性的模型在我们实验中表现最佳。因此我们考量跨架构与目标的预训练模型适配。我们发现,预训练的非因果解码器模型可经自回归语言建模作为下游任务适配为高性能生成式因果解码器模型。此外,我们发现预训练因果解码器模型可高效适配为非因果解码器模型,最终在多任务微调后取得有竞争力的表现。代码与检查点见 https://github.com/bigscience-workshop/architecture-objective。

关键词

引用

@article{arxiv.2204.05832,
  title  = {What Language Model Architecture and Pretraining Objective Work Best for Zero-Shot Generalization?},
  author = {Thomas Wang and Adam Roberts and Daniel Hesslow and Teven Le Scao and Hyung Won Chung and Iz Beltagy and Julien Launay and Colin Raffel},
  journal= {arXiv preprint arXiv:2204.05832},
  year   = {2022}
}