HintedBT:利用质量与音译提示增强回译
计算与语言
2021-09-10 v1 人工智能
机器学习
摘要
目标单语语料库的回译 (Back-Translation, BT) 是神经机器翻译 (Neural Machine Translation, NMT) 中一种广泛使用的数据增强策略,尤其适用于低资源语言对。为了提高可用 BT 数据的有效性,我们引入了 HintedBT——一系列向编码器和解码器提供提示(通过标签)的技术。首先,我们提出了一种同时使用高质量和低质量 BT 数据的新方法,通过向模型提供关于每个源-目标对质量的提示(作为编码器上的源标签)来实现。我们不过滤掉低质量数据,而是表明这些提示使模型能够有效地从噪声数据中学习。其次,我们解决了预测源词元是需要翻译还是音译到目标语言的问题,这在跨文字翻译任务(即源语言和目标语言不共享书写文字)中很常见。对于此类情况,我们提出用额外的提示(作为解码器上的目标标签)来训练模型,这些提示提供了关于源语言所需操作(仅翻译或翻译兼音译)的信息。我们在三个跨文字低/中资源语言对:{印地语、古吉拉特语、泰米尔语}-英语的标准 WMT 基准上进行了实验和详细分析。我们的方法与五个强有力且成熟的基线相比表现良好。我们表明,单独或共同使用这些提示均能显著提高翻译质量,并在相应双语设置下的所有三个语言对中实现了 SOTA 性能。
引用
@article{arxiv.2109.04443,
title = {HintedBT: Augmenting Back-Translation with Quality and Transliteration Hints},
author = {Sahana Ramnath and Melvin Johnson and Abhirut Gupta and Aravindan Raghuveer},
journal= {arXiv preprint arXiv:2109.04443},
year = {2021}
}
备注
17 pages including references and appendix. Accepted at EMNLP 2021