关于预训练语言模型的可比性
计算与语言
2020-07-22 v1 机器学习
机器学习
摘要
无监督表示学习的最新进展已成功确立了 NLP 中迁移学习的概念。推动该研究领域进步的主要是三股力量:更精细的架构更好地利用了上下文信息。这些模型不再简单地插入静态预训练表示,而是基于周围上下文,在具有更智能设计的语言建模目标的可端到端训练的模型中学习得到。与此同时,更大的语料库被用作以自监督方式预训练大型语言模型的资源,随后这些模型在有监督任务上微调。并行计算与云计算的进步使得这些模型能够在比以前已有模型相同或更短时间内以不断增长的容量进行训练。这三方面的发展汇聚成以越来越高频率发布的新 state-of-the-art (SOTA) 结果。由于无法完全分离三股驱动力量的贡献,这些改进源自何处并不总是显而易见的。我们致力于就若干在近两年取得 SOTA 结果的大型预训练语言模型,针对其对新架构与资源的使用提供清晰简明的概览。我们想为读者阐明这些模型之间的差异所在,并进一步试图洞察词汇/计算改进以及架构变化的单独贡献。我们明确无意量化这些贡献,而是将我们的工作视为一个概览,以识别基准比较的潜在起点。此外,我们试探性地指出开放源代码与可复现研究领域中的潜在改进可能。
引用
@article{arxiv.2001.00781,
title = {On the comparability of Pre-trained Language Models},
author = {Matthias Aßenmacher and Christian Heumann},
journal= {arXiv preprint arXiv:2001.00781},
year = {2020}
}