中文

关于反向翻译中的合成数据

计算与语言 2023-12-25 v1

摘要

反向翻译(BT)是神经机器翻译(NMT)研究领域中最重要的技术之一。现有的 BT 尝试有一个共同特征:它们使用束搜索或随机采样以反向模型生成合成数据,但极少有研究考察合成数据在 BT 性能中的作用。这促使我们提出一个基本问题:何种合成数据有助于 BT 性能?通过理论与实证研究,我们确定了控制反向翻译 NMT 性能的合成数据的两个关键因素,即质量与重要性。此外,基于我们的发现,我们提出一种简单而有效的方法生成合成数据,以更好地权衡这两个因素,从而为 BT 带来更好性能。我们在 WMT14 DE-EN、EN-DE 和 RU-EN 基准任务上进行了大量实验。通过使用我们提出的方法生成合成数据,我们的 BT 模型显著优于标准 BT 基线(即基于束搜索与采样的数据生成方法),证明了我们所提方法的有效性。

关键词

引用

@article{arxiv.2310.13675,
  title  = {On Synthetic Data for Back Translation},
  author = {Jiahao Xu and Yubin Ruan and Wei Bi and Guoping Huang and Shuming Shi and Lihui Chen and Lemao Liu},
  journal= {arXiv preprint arXiv:2310.13675},
  year   = {2023}
}