目标条件采样:优化多语言神经机器翻译的数据选择
计算与语言
2019-05-21 v1
摘要
为利用多语言语料库改进低资源神经机器翻译(NMT),仅以最相关的低资源语言对应的高资源语言进行训练通常比使用所有可用数据更有效(Neubig and Hu, 2018)。然而,一种智能的数据选择策略有可能进一步利用来自其他辅助语言的数据改进低资源 NMT。本文中,我们试图在所有多语言数据上构造一个采样分布,使其最小化低资源语言的训练损失。基于该表述,我们提出了一种高效算法——目标条件采样(TCS),其首先采样一个目标句,然后条件采样其源句。实验表明,在我们测试的四种语言中的三种上,TCS 带来了高达 2 BLEU 的显著增益,且训练开销极小。
引用
@article{arxiv.1905.08212,
title = {Target Conditioned Sampling: Optimizing Data Selection for Multilingual Neural Machine Translation},
author = {Xinyi Wang and Graham Neubig},
journal= {arXiv preprint arXiv:1905.08212},
year = {2019}
}
备注
Accepted at ACL 2019