gaBERT——一个爱尔兰语语言模型
计算与语言
2022-06-29 v4
摘要
BERT 系列神经语言模型因其能够为文本序列提供对许多 NLP 任务具有良好泛化能力的、富含上下文敏感的词元编码而变得极为流行。我们介绍了 gaBERT,一个面向爱尔兰语的单语 BERT 模型。我们将 gaBERT 模型与多语 BERT 以及单语 Irish WikiBERT 进行比较,并表明 gaBERT 在下游解析任务上提供了更好的表示。我们还展示了不同的过滤准则、词表大小以及子词分词模型的选择如何影响下游性能。我们比较了为识别动词性多词表达式任务微调 gaBERT 模型与 mBERT 模型的结果,并表明微调后的 gaBERT 模型在该任务上也表现更好。我们向社区发布了 gaBERT 及相关代码。
引用
@article{arxiv.2107.12930,
title = {gaBERT -- an Irish Language Model},
author = {James Barry and Joachim Wagner and Lauren Cassidy and Alan Cowap and Teresa Lynn and Abigail Walsh and Mícheál J. Ó Meachair and Jennifer Foster},
journal= {arXiv preprint arXiv:2107.12930},
year = {2022}
}
备注
Proceedings of the 13th Conference on Language Resources and Evaluation (LREC 2022), pages 4774-4788, Marseille, France, 20-25 June 2022, European Language Resources Association (ELRA)