中文

RobBERT-2022:更新荷兰语语言模型以适配演化中的语言使用

计算与语言 2022-11-16 v1 机器学习

摘要

基于Transformer的大型语言模型,如BERT和GPT-3,在大多数自然语言处理任务上优于以往的架构。此类语言模型首先在海量文本语料上进行预训练,随后作为基础模型在特定任务上微调。由于预训练步骤通常不再重复,基础模型无法及时更新最新信息。本文中,我们更新了RobBERT——一个基于RoBERTa的、在2019年训练的顶尖荷兰语语言模型。首先,更新RobBERT的分词器以纳入最新荷兰语OSCAR语料中出现的高频新词,例如与冠状病毒相关的词汇。随后我们使用该数据集进一步预训练RobBERT模型。为评估新模型能否作为RobBERT的即插即用替代,我们基于已有词元的概念漂移和新词元对齐引入了两项额外准则。我们发现,对于某些语言任务,此次更新带来了显著的性能提升。这些结果凸显了持续更新语言模型以适配演化中语言使用的益处。

关键词

引用

@article{arxiv.2211.08192,
  title  = {RobBERT-2022: Updating a Dutch Language Model to Account for Evolving Language Use},
  author = {Pieter Delobelle and Thomas Winters and Bettina Berendt},
  journal= {arXiv preprint arXiv:2211.08192},
  year   = {2022}
}

备注

9 pages, 1 figure, 3 tables