AdMix:一种用于神经机器翻译的混合样本数据增强方法
计算与语言
2022-05-11 v1
摘要
在神经机器翻译(NMT)中,反向翻译等数据增强方法已证明其提升翻译性能的有效性。本文提出一种新颖的 NMT 数据增强方法,其不依赖于任何额外的训练数据。我们的方法 AdMix 由两部分组成:1) 向原始句对引入微弱离散噪声(词语替换、词语丢弃、词语交换)以形成增强样本;2) 在训练语料中通过将增强样本与其原始样本进行软混合来生成新的合成训练数据。在不同规模的三个翻译数据集上的实验表明,AdMix 相比强大的 Transformer 基线取得了显著提升(1.0 至 2.7 个 BLEU 点)。当与其他数据增强技术(如反向翻译)结合时,我们的方法可获得进一步提升。
引用
@article{arxiv.2205.04686,
title = {AdMix: A Mixed Sample Data Augmentation Method for Neural Machine Translation},
author = {Chang Jin and Shigui Qiu and Nini Xiao and Hao Jia},
journal= {arXiv preprint arXiv:2205.04686},
year = {2022}
}