中文

低资源语言的预训练数据质量与数量:马耳他语新语料库与 BERT 模型

计算与语言 2022-08-09 v2

摘要

诸如 mBERT 的多语言语言模型已展现出对多种语言的令人印象深刻的跨语言迁移能力,但许多语言仍被排除在这些模型之外。本文中,我们针对一种未被纳入 mBERT 的低资源语言——马耳他语,分析使用单语数据进行预训练在不同预训练设置下的影响。我们使用新预训练的模型在三项形态句法任务——依存句法分析、词性标注和命名实体识别——以及一项语义分类任务——情感分析——上进行评测。我们还提出了一个新创建的马耳他语语料库,并确定了预训练数据规模和领域对下游性能的影响。我们的结果表明,使用混合的预训练领域通常优于仅使用维基百科文本。我们还发现,该语料库的一小部分就足以在性能上相较基于维基百科训练的模型取得显著飞跃。我们在新语料库上预训练并比较了两个模型:从头训练的单语 BERT 模型(BERTu),以及进一步预训练的多语言 BERT(mBERTu)。尽管新语料库远小于高资源语言通常使用的语料库,这些模型在这些任务上取得了最先进的性能。平均而言,BERTu 优于或与 mBERTu 具有竞争力,且在较高级任务上观察到最大的增益。

关键词

引用

@article{arxiv.2205.10517,
  title  = {Pre-training Data Quality and Quantity for a Low-Resource Language: New Corpus and BERT Models for Maltese},
  author = {Kurt Micallef and Albert Gatt and Marc Tanti and Lonneke van der Plas and Claudia Borg},
  journal= {arXiv preprint arXiv:2205.10517},
  year   = {2022}
}

备注

DeepLo 2022 camera-ready version