中文

RobBERT:基于 RoBERTa 的荷兰语语言模型

计算与语言 2020-09-17 v2 机器学习

摘要

近年来,预训练语言模型一直主导着自然语言处理领域,并为各种复杂的自然语言任务带来了显著的性能提升。最著名的预训练语言模型之一是 BERT,其发布了英文版和多语言版。尽管多语言 BERT 在许多任务上表现良好,但最近的研究表明,在单一语言上训练的 BERT 模型显著优于多语言版本。因此,训练荷兰语 BERT 模型对于广泛的荷兰语 NLP 任务具有很大潜力。虽然先前的方法使用 BERT 的早期实现来训练荷兰语版本的 BERT,但我们使用了鲁棒优化的 BERT 方法 RoBERTa 来训练一个名为 RobBERT 的荷兰语语言模型。我们衡量了其在各种任务上的性能以及微调数据集规模的重要性。我们还评估了特定语言分词器的重要性和模型的公平性。我们发现 RobBERT 改进了各种任务的最先进结果,尤其是在处理较小数据集时显著优于其他模型。这些结果表明,它是用于大量荷兰语语言任务的强大预训练模型。预训练和微调后的模型已公开可用,以支持进一步的下游荷兰语 NLP 应用。

关键词

引用

@article{arxiv.2001.06286,
  title  = {RobBERT: a Dutch RoBERTa-based Language Model},
  author = {Pieter Delobelle and Thomas Winters and Bettina Berendt},
  journal= {arXiv preprint arXiv:2001.06286},
  year   = {2020}
}

备注

11 pages, 4 tables, 3 figures. Accepted in EMNLP Findings