中文

大规模预训练基于 Transformer 的波兰语语言模型

计算与语言 2020-06-11 v2

摘要

基于 Transformer 的语言模型现已广泛应用于自然语言处理(NLP)。这一论断对英语尤为确切,近年来许多利用 Transformer 架构的预训练模型已发表。这推动了分类、回归与序列标注等各类标准 NLP 任务,以及机器翻译、问答或摘要等文本到文本任务的技术水平。然而,对于诸如波兰语之类的低资源语言,情况有所不同。尽管已有一些面向波兰语的基于 Transformer 的语言模型,但在语料规模与参数数量方面,无一接近最大英语模型的规模。在本研究中,我们提出两个基于流行 BERT 架构的波兰语语言模型。较大的模型在一个由超过 10 亿波兰语句、或 135GB 原始文本组成的数据集上训练。我们描述了收集数据、准备语料与预训练模型的方法。随后我们在十三个波兰语语言任务上评估了我们的模型,并在其中十一个任务上展示了相较先前方法的改进。

关键词

引用

@article{arxiv.2006.04229,
  title  = {Pre-training Polish Transformer-based Language Models at Scale},
  author = {Sławomir Dadas and Michał Perełkiewicz and Rafał Poświata},
  journal= {arXiv preprint arXiv:2006.04229},
  year   = {2020}
}