RobBERT:基于 RoBERTa 的荷兰语语言模型
计算与语言
2020-09-17 v2 机器学习
摘要
近年来,预训练语言模型一直主导着自然语言处理领域,并为各种复杂的自然语言任务带来了显著的性能提升。最著名的预训练语言模型之一是 BERT,其发布了英文版和多语言版。尽管多语言 BERT 在许多任务上表现良好,但最近的研究表明,在单一语言上训练的 BERT 模型显著优于多语言版本。因此,训练荷兰语 BERT 模型对于广泛的荷兰语 NLP 任务具有很大潜力。虽然先前的方法使用 BERT 的早期实现来训练荷兰语版本的 BERT,但我们使用了鲁棒优化的 BERT 方法 RoBERTa 来训练一个名为 RobBERT 的荷兰语语言模型。我们衡量了其在各种任务上的性能以及微调数据集规模的重要性。我们还评估了特定语言分词器的重要性和模型的公平性。我们发现 RobBERT 改进了各种任务的最先进结果,尤其是在处理较小数据集时显著优于其他模型。这些结果表明,它是用于大量荷兰语语言任务的强大预训练模型。预训练和微调后的模型已公开可用,以支持进一步的下游荷兰语 NLP 应用。
引用
@article{arxiv.2001.06286,
title = {RobBERT: a Dutch RoBERTa-based Language Model},
author = {Pieter Delobelle and Thomas Winters and Bettina Berendt},
journal= {arXiv preprint arXiv:2001.06286},
year = {2020}
}
备注
11 pages, 4 tables, 3 figures. Accepted in EMNLP Findings