适配单语模型:当语言相似度高时数据可能稀缺
计算与语言
2021-08-03 v2
摘要
对于许多(少数)语言,训练大型模型所需的资源并不可用。我们研究了在尽可能少的数据下零样本迁移学习的性能,以及语言相似度在此过程中的影响。我们使用来自两种低资源目标语言变体的数据重新训练四个基于 BERT 的模型的词法层,而 Transformer 层则在模型的源语言上针对词性标注(POS-tagging)任务独立微调。通过组合新的词法层与微调后的 Transformer 层,我们为两种目标语言均取得了较高的任务性能。在语言相似度高时,10MB 的数据似乎足以实现显著的单语迁移性能。即便目标语言已包含在多语模型之中,单语基于 BERT 的模型在重训词法层后通常比多语 BERT 取得更高的下游任务性能。
引用
@article{arxiv.2105.02855,
title = {Adapting Monolingual Models: Data can be Scarce when Language Similarity is High},
author = {Wietse de Vries and Martijn Bartelds and Malvina Nissim and Martijn Wieling},
journal= {arXiv preprint arXiv:2105.02855},
year = {2021}
}
备注
Findings of ACL 2021 Camera Ready