英语中间任务训练同样改善零样本跨语言迁移
计算与语言
2020-10-02 v2
摘要
中间任务训练——在目标任务上再次微调之前先对预训练模型在一个中间任务上微调——在单语英语环境下的语言理解任务中常能大幅提升模型性能。我们研究英语中间任务训练在非英语目标任务上是否仍具帮助。利用九个中间语言理解任务,我们在 XTREME 基准上以零样本跨语言设定评估中间任务迁移。我们在 BUCC 和 Tatoeba 句子检索任务上看到中间训练的显著提升,在问答目标任务上有中等提升。MNLI、SQuAD 和 HellaSwag 作为中间任务取得最佳总体结果,而多任务中间训练带来微小额外提升。通过对每个目标任务使用我们最佳的中间任务模型,我们在 XTREME 基准上较 XLM-R Large 获得 5.4 分的提升,创下截至 2020 年 6 月的 state of the art。我们还研究了在中间任务训练期间继续多语 MLM 以及使用机器翻译的中间任务数据,但二者均未一致地优于简单的英语中间任务训练。
引用
@article{arxiv.2005.13013,
title = {English Intermediate-Task Training Improves Zero-Shot Cross-Lingual Transfer Too},
author = {Jason Phang and Iacer Calixto and Phu Mon Htut and Yada Pruksachatkun and Haokun Liu and Clara Vania and Katharina Kann and Samuel R. Bowman},
journal= {arXiv preprint arXiv:2005.13013},
year = {2020}
}