中文

面向低资源语系的目标多语言适配

计算与语言 2024-05-22 v1

摘要

众所周知,多语言模型的“大规模多语言”训练限制了其在任何单一语言中的效用,并且它们在低资源语言上的表现尤为糟糕。然而,有证据表明,低资源语言可以从目标多语言性中受益,即模型在密切相关的语言上进行训练。为了更严格地测试这种方法,我们系统地研究了将预训练模型适配到某一语系的最佳实践。以乌拉尔语系为测试案例,我们在各种配置下适配 XLM-R 以对 15 种语言进行建模;然后我们在两个下游任务和 11 种评估语言上评估每种实验设置的性能。我们适配后的模型显著优于单语和多语言基线。此外,对超参数影响的回归分析表明,适配的词表大小对低资源语言相对不重要,并且低资源语言在训练期间可以被激进地上采样,而对高资源语言的性能几乎没有损害。这些结果引入了在目标设置下进行语言适配的新最佳实践。

关键词

引用

@article{arxiv.2405.12413,
  title  = {Targeted Multilingual Adaptation for Low-resource Language Families},
  author = {C. M. Downey and Terra Blevins and Dhwani Serai and Dwija Parikh and Shane Steinert-Threlkeld},
  journal= {arXiv preprint arXiv:2405.12413},
  year   = {2024}
}