论双向性在语言模型预训练中的作用
计算与语言
2022-10-27 v2 人工智能
机器学习
摘要
先前关于语言模型预训练的工作探索了不同的架构和学习目标,但数据、超参数和评估上的差异使得原则性比较十分困难。在本工作中,我们聚焦于双向性这一区分现有方法的关键因素,并对其在下一词预测、文本填充、零样本 priming 和微调中的作用进行了全面研究。我们提出了一个泛化先前方法的新框架,包括像 GPT 这样的全单向模型、像 BERT 这样的全双向模型,以及像 CM3 和前缀 LM 这样的混合模型。我们的框架区分了双向性的两个概念(双向上下文与双向注意力),并允许分别控制二者。我们发现最优配置在很大程度上依赖于应用(例如,双向注意力有益于微调和填充,但对下一词预测和零样本 priming 有害)。我们训练了参数量高达 6.7B 的模型,并发现差异在规模下保持一致。虽然先前关于规模化的工作聚焦于从左至右的自回归模型,我们的结果表明该方法伴随一些权衡,开发超大规模双向模型或许是值得的。
引用
@article{arxiv.2205.11726,
title = {On the Role of Bidirectionality in Language Model Pre-Training},
author = {Mikel Artetxe and Jingfei Du and Naman Goyal and Luke Zettlemoyer and Ves Stoyanov},
journal= {arXiv preprint arXiv:2205.11726},
year = {2022}
}
备注
Findings of EMNLP 2022