训练数据集与词典规模在BERT模型中的影响:以波罗的海语言为例
计算与语言
2021-12-21 v1
摘要
大型预训练掩码语言模型已成为许多自然语言处理(NLP)问题的最先进解决方案。尽管研究表明单语模型比多语模型产生更好的结果,但训练数据集必须足够大。我们训练了一个针对立陶宛语、拉脱维亚语和英语的三语LitLat类BERT模型,以及针对爱沙尼亚语的单语Est-RoBERTa模型。我们在四个下游任务上评估其性能:命名实体识别、依存句法分析、词性标注和词语类比。为了分析专注于单一语言以及大训练集的重要性,我们将所创建的模型与现有的爱沙尼亚语、拉脱维亚语和立陶宛语的单语及多语BERT模型进行比较。结果表明,新创建的LitLat BERT和Est-RoBERTa模型在大多数情况下改善了现有模型在所有测试任务上的结果。
引用
@article{arxiv.2112.10553,
title = {Training dataset and dictionary sizes matter in BERT models: the case of Baltic languages},
author = {Matej Ulčar and Marko Robnik-Šikonja},
journal= {arXiv preprint arXiv:2112.10553},
year = {2021}
}
备注
12 pages. To be published in proceedings of the AIST 2021 conference