AR:面向神经机器翻译的合成数据自动修复
计算与语言
2020-04-07 v1
摘要
与仅使用有限的真实平行数据作为训练语料相比,许多研究已证明,将反向翻译(BT)或正向翻译(FT,或自训练)生成的合成平行数据纳入 NMT 训练过程可显著提升翻译质量。然而,作为一个众所周知的缺陷,合成平行数据是含噪的,因为它们由一个不完美的 NMT 系统生成。因此,合成平行数据带来的翻译质量提升被大幅削弱。在本文中,我们提出一种新颖的自动修复(AR)框架以提升合成数据质量。我们提出的 AR 模型可基于大规模单语数据,利用 BT 与 FT 技术,学习从低质量(含噪)输入句到高质量句的转换。合成平行数据中的噪声将被所提 AR 模型充分消除,随后修复后的合成平行数据可帮助 NMT 模型取得更大的提升。实验结果表明,我们的方法能有效提升合成平行数据的质量,且采用修复后合成数据的 NMT 模型在 WMT14 EN→DE 与 IWSLT14 DE→EN 翻译任务上均取得了一致的提升。
引用
@article{arxiv.2004.02196,
title = {AR: Auto-Repair the Synthetic Data for Neural Machine Translation},
author = {Shanbo Cheng and Shaohui Kuang and Rongxiang Weng and Heng Yu and Changfeng Zhu and Weihua Luo},
journal= {arXiv preprint arXiv:2004.02196},
year = {2020}
}