为跨语言迁移建模潜在翻译
计算与语言
2021-07-26 v1
摘要
尽管基于翻译的跨语言迁移在多个任务和语言中取得了 SOTA 结果,但它常常被忽视,而更倾向于使用大规模多语言预训练编码器。可以说,这是由于其主要的局限性:1)翻译错误渗透到分类阶段;2)最大似然翻译的表达能力不足。为了解决这个问题,我们提出了一种新技术,通过将中间翻译视为潜在随机变量,将传统流水线的两个步骤(翻译和分类)整合到一个单一模型中。因此,1)可以使用最小风险训练的变体对神经机器翻译系统进行微调,其中奖励是下游任务分类器的准确率。此外,2)在推理过程中可以抽取多个样本,以近似所有可能翻译的期望损失。我们在一系列多语言 NLU 任务上评估了我们新颖的基于潜在翻译的模型,包括常识推理、释义识别和自然语言推理。我们报告了在零样本和少样本学习设置下的提升,平均高达 2.7 个准确率点,这对于低资源语言(例如海地克里奥尔语)更为显著。最后,我们进行了深入分析,比较了不同的底层 NMT 模型,并评估了替代翻译对下游性能的影响。
引用
@article{arxiv.2107.11353,
title = {Modelling Latent Translations for Cross-Lingual Transfer},
author = {Edoardo Maria Ponti and Julia Kreutzer and Ivan Vulić and Siva Reddy},
journal= {arXiv preprint arXiv:2107.11353},
year = {2021}
}