中文

数据 rejuvenation:利用非活跃训练样本于神经机器翻译

计算与语言 2020-10-07 v1

摘要

大规模训练数据集是神经机器翻译(NMT)模型近期成功的核心。然而,大规模数据中复杂的模式和潜在的噪声使得 NMT 模型的训练困难。在这项工作中,我们探索识别对模型性能贡献较小的非活跃训练样本,并表明非活跃样本的存在取决于数据分布。我们进一步引入数据 rejuvenation,通过利用非活跃样本改进 NMT 模型在大规模数据集上的训练。所提出的框架包括三个阶段。首先,我们在原始训练数据上训练一个识别模型,并利用其根据句子级输出概率区分非活跃样本和活跃样本。然后,我们在活跃样本上训练一个 rejuvenation 模型,用于通过前向翻译为非活跃样本重新标注。最后,将 rejuvenated 样本与活跃样本结合以训练最终的 NMT 模型。在 WMT14 英德和英法数据集上的实验结果表明,所提出的数据 rejuvenation 持续且显著地改进了多个强 NMT 模型的性能。广泛的分析揭示我们的方法稳定并加速了 NMT 模型的训练过程,从而得到具有更好泛化能力的最终模型。

关键词

引用

@article{arxiv.2010.02552,
  title  = {Data Rejuvenation: Exploiting Inactive Training Examples for Neural Machine Translation},
  author = {Wenxiang Jiao and Xing Wang and Shilin He and Irwin King and Michael R. Lyu and Zhaopeng Tu},
  journal= {arXiv preprint arXiv:2010.02552},
  year   = {2020}
}

备注

Accepted to EMNLP 2020 main conference, 12 pages