从英语到外语:预训练语言模型的迁移
计算与语言
2020-04-30 v2
摘要
预训练模型已在许多下游自然语言处理(NLP)任务中展现出其有效性。多语言预训练模型的可用性使得 NLP 任务能够从高资源语言零样本迁移到低资源语言。然而,近期改进预训练模型的研究严重聚焦于英语。尽管可以从头开始为其他语言训练最新的神经架构,但由于所需的计算量,这是不可取的。在这项工作中,我们在有限的计算预算下解决将现有英语预训练模型迁移到其他语言的问题。使用单块 GPU,我们的方法可以在一天内获得外语 BERT base 模型,并在两天内获得外语 BERT large 模型。此外,我们在六种语言上评估我们的模型,表明我们的模型在自然语言推理和依存句法分析这两个零样本任务上优于多语言 BERT。
引用
@article{arxiv.2002.07306,
title = {From English To Foreign Languages: Transferring Pre-trained Language Models},
author = {Ke Tran},
journal= {arXiv preprint arXiv:2002.07306},
year = {2020}
}