中文

面向跨语言迁移的模型选择

计算与语言 2021-09-13 v2 机器学习

摘要

在多语言语料库上预训练的 Transformer(如 mBERT 和 XLM-RoBERTa)已取得了令人印象深刻的跨语言迁移能力。在零样本迁移设定下,仅使用英语训练数据,并将微调后的模型在另一目标语言上评估。尽管这出奇地有效,但不同微调运行之间目标语言性能存在显著方差,且在零样本设定下,没有目标语言开发数据可用于在多个微调模型中进行选择。先前工作依赖英语开发数据来在具有不同学习率、步数及其他超参数微调的模型间选择,常导致次优选择。在本文中,我们表明当辅助枢纽语言中有少量标注数据可用时,可以一致地选择更好的模型。我们提出了一种机器学习模型选择方法,利用微调模型自身的内部表示来预测其跨语言能力。在大量实验中,我们发现该方法在二十五种语言(包括八种低资源语言)上一致地选择了比英语验证数据更好的模型,且常取得与使用目标语言开发数据进行模型选择相当的结果。

关键词

引用

@article{arxiv.2010.06127,
  title  = {Model Selection for Cross-Lingual Transfer},
  author = {Yang Chen and Alan Ritter},
  journal= {arXiv preprint arXiv:2010.06127},
  year   = {2021}
}

备注

EMNLP 2021