迭代式领域修复反向翻译
计算与语言
2020-10-07 v1
摘要
在本文中,我们关注低资源下的特定领域翻译,其中领域内平行语料稀缺或不存在。对此情形一种常见且有效的策略是利用领域内单语数据结合反向翻译(back-translation)方法。然而,由于合成平行数据是由不完美的域外系统生成的,其噪声很大,导致领域自适应性能较差。为解决此问题,我们提出一种新颖的迭代式领域修复反向翻译框架,其引入领域修复(Domain-Repair, DR)模型来精炼合成双语数据中的翻译。为此,我们通过将单语句子进行往返翻译来构建 DR 模型训练所需的数据,进而设计统一训练框架以联合优化成对的 DR 与 NMT 模型。在特定领域间以及从通用领域到特定领域的 NMT 模型自适应实验证明了我们所提方法的有效性,相较未自适应模型和反向翻译分别平均取得了 15.79 和 4.47 的 BLEU 提升。
引用
@article{arxiv.2010.02473,
title = {Iterative Domain-Repaired Back-Translation},
author = {Hao-Ran Wei and Zhirui Zhang and Boxing Chen and Weihua Luo},
journal= {arXiv preprint arXiv:2010.02473},
year = {2020}
}
备注
EMNLP 2020 long paper