中文

如何将预训练多语言模型适配到 1600 种语言

计算与语言 2021-06-07 v1

摘要

预训练多语言模型(PMMs)通过跨语言迁移实现零样本学习,对预训练期间所见语言表现最佳。尽管存在改进未见语言性能的方法,但它们几乎仅在仅适用于世界上一小部分语言的原始文本量级上进行了评估。在本文中,我们使用一种可用于超过 1600 种语言的资源:《新约》来评估现有方法将 PMMs 适配到新语言的性能。这具有挑战性,原因有二:(1)语料规模小,(2)领域狭窄。尽管所有方法的性能均有所下降,但令人惊讶的是,与 XLM-R 相比,我们在所有语言上的词性标注准确率平均仍提升高达 17.69%17.69\%,命名实体识别(NER)F1 平均提升 6.296.29。另一个意外发现是,最简单的方案——继续预训练——表现最佳。最后,我们进行案例研究以解耦领域与规模的影响,并阐明微调源语言的作用。

关键词

引用

@article{arxiv.2106.02124,
  title  = {How to Adapt Your Pretrained Multilingual Model to 1600 Languages},
  author = {Abteen Ebrahimi and Katharina Kann},
  journal= {arXiv preprint arXiv:2106.02124},
  year   = {2021}
}

备注

Accepted to ACL 2021