中文

将单语模型迁移至低资源语言:以提格里尼亚语为例

计算与语言 2020-06-22 v2 机器学习

摘要

近年来,Transformer 模型在自然语言处理(NLP)任务中取得了巨大成功。当前大多数最先进的 NLP 成果都是通过使用单语 Transformer 模型实现的,其中模型使用单一语言的未标注文本语料库进行预训练。然后,该模型再针对特定的下游任务进行微调。然而,对于大多数语言而言,预训练一个新的 Transformer 模型的成本很高。在这项工作中,我们提出了一种经济高效的迁移学习方法,将从一个大型单语语料库训练出的强大源语言模型适配到低资源语言。因此,使用 XLNet 语言模型,我们在跨语言情感(CLS)数据集和一个新的低资源语言提格里尼亚语的情感分析数据集上,展示了与 mBERT 和预训练目标语言模型相比具有竞争力的性能。仅使用给定的提格里尼亚语情感分析数据集的 10k 个样本,英文 XLNet 就取得了 78.88% 的 F1 分数,分别比 BERT 和 mBERT 高出 10% 和 7%。更有趣的是,在 CLS 数据集上微调(英语)XLNet 模型与 mBERT 相比取得了令人鼓舞的结果,甚至在一个日语数据集上超越了 mBERT。

关键词

引用

@article{arxiv.2006.07698,
  title  = {Transferring Monolingual Model to Low-Resource Language: The Case of Tigrinya},
  author = {Abrhalei Tela and Abraham Woubie and Ville Hautamaki},
  journal= {arXiv preprint arXiv:2006.07698},
  year   = {2020}
}