基于词典的数据增强用于跨领域神经机器翻译
计算与语言
2020-04-07 v1
摘要
现有的用于神经机器翻译(NMT)的数据增强方法主要依赖于对领域内(IND)单语语料进行回译。这些方法受领域信息鸿沟相关问题的困扰,导致低频和集外术语的翻译错误。本文提出一种用于跨领域 NMT 的基于词典的数据增强(DDA)方法。DDA 将领域特定词典与通用领域语料合成,自动生成大规模伪 IND 平行语料。生成的伪 IND 数据可用于增强通用领域训练的基线模型。实验表明,DDA 增强的 NMT 模型表现出一致且显著的提升,以 3.75-11.53 BLEU 优于基线模型。所提方法还能进一步提升基于回译和 IND 微调的 NMT 模型性能。该提升与 DDA 产生的增强领域覆盖度相关。
引用
@article{arxiv.2004.02577,
title = {Dictionary-based Data Augmentation for Cross-Domain Neural Machine Translation},
author = {Wei Peng and Chongxuan Huang and Tianhao Li and Yun Chen and Qun Liu},
journal= {arXiv preprint arXiv:2004.02577},
year = {2020}
}