中文

罗马尼亚 BERT 的诞生

计算与语言 2020-09-21 v1

摘要

大规模预训练语言模型已在自然语言处理中变得无处不在。然而,这些模型大多或以高资源语言(尤其是英语)提供,或作为以牺牲单语性能换取覆盖度的多语言模型。本文介绍 Romanian BERT,首个纯罗马尼亚语的基于 transformer 的语言模型,在大型文本语料上预训练。我们讨论了语料组成与清洗、模型训练过程,以及该模型在多个罗马尼亚语数据集上的广泛评估。我们不仅开源了模型本身,还开源了一个仓库,其中包含如何获取语料、如何在生产环境中微调并使用该模型(含实际示例),以及如何完整复现评估过程的信息。

关键词

引用

@article{arxiv.2009.08712,
  title  = {The birth of Romanian BERT},
  author = {Stefan Daniel Dumitrescu and Andrei-Marius Avram and Sampo Pyysalo},
  journal= {arXiv preprint arXiv:2009.08712},
  year   = {2020}
}

备注

5 pages (4 + reference page), accepted in Findings of EMNLP 2020