中文

为何不使用所有语言?少样本跨语言迁移中基于梯度优化的混合训练

计算与语言 2022-05-02 v1

摘要

当前少样本跨语言迁移学习的最优方法首先在以源语言的大量标注数据上训练,然后在目标语言上以少量样本微调,称为目标自适应。尽管已被证明在多种任务上有效,本文中我们展示了该方法的若干不足,并提出了一种一步混合训练方法,该方法以源与目标数据同时训练,采用\textit{随机梯度手术}这一新颖的梯度级优化。与以往目标自适应时一次关注一种语言的研究不同,我们使用一个模型同时处理所有目标语言,以避免过度语言特定的模型。此外,我们讨论了以往文献中利用大型目标开发集进行模型选择的不现实性。我们进一步表明,我们的方法对目标语言既无需开发集,也能摆脱过拟合问题。我们在多达48种语言上的4项多样NLP任务上进行了大规模实验。我们提出的方法在所有任务上取得最优性能,并大幅优于目标自适应,尤其对于与源语言语言距离远的语言,例如NER任务上平均7.36%的F1绝对提升,旁遮普语上最高达17.60%。

关键词

引用

@article{arxiv.2204.13869,
  title  = {Por Qu\'e N\~ao Utiliser Alla Spr{\aa}k? Mixed Training with Gradient Optimization in Few-Shot Cross-Lingual Transfer},
  author = {Haoran Xu and Kenton Murray},
  journal= {arXiv preprint arXiv:2204.13869},
  year   = {2022}
}

备注

Accepted at Findings of NAACL 2022