中文

多语言模型是否为中等低资源语言的最佳选择?以加泰罗尼亚语为例的综合评估

计算与语言 2021-07-19 v1

摘要

多语言语言模型是一项关键突破,因为它们显著减少了对低资源语言的数据需求。然而,对于能够获取大量数据的语言,特定语言模型的优越性已被证实。在这项工作中,我们聚焦于加泰罗尼亚语,旨在探索中等规模单语语言模型在多大程度上能与最先进的大型多语言模型竞争。为此,我们:(1) 构建了一个干净、高质量的加泰罗尼亚语文本语料库(CaText),这是迄今为止最大的语料库(但仅为先前单语语言模型工作常用规模的一小部分),(2) 训练了一个基于 Transformer 的加泰罗尼亚语语言模型(BERTa),以及 (3) 设计了一套涵盖多种设置的详尽评估,包括一整套下游任务,即词性标注、命名实体识别与分类、文本分类、问答和语义文本相似度,其中大多数相应数据集为全新创建。结果是一个新的基准,即加泰罗尼亚语语言理解基准(CLUB),我们将其作为开放资源发布,同时发布的还有干净文本语料库、语言模型和清洗流程。使用最先进的多语言模型以及仅在维基百科上训练的单语模型作为基线,我们一致观察到我们的模型在各项任务和设置中的优越性。

关键词

引用

@article{arxiv.2107.07903,
  title  = {Are Multilingual Models the Best Choice for Moderately Under-resourced Languages? A Comprehensive Assessment for Catalan},
  author = {Jordi Armengol-Estapé and Casimiro Pio Carrino and Carlos Rodriguez-Penagos and Ona de Gibert Bonet and Carme Armentano-Oller and Aitor Gonzalez-Agirre and Maite Melero and Marta Villegas},
  journal= {arXiv preprint arXiv:2107.07903},
  year   = {2021}
}

备注

Accepted into Findings of ACL-IJCNLP 2021