中文

通过双向训练改进神经机器翻译

计算与语言 2021-09-17 v1

摘要

我们提出了一种简单而有效的预训练策略——用于神经机器翻译的双向训练(BiT)。具体而言,我们在训练早期阶段对模型参数进行双向更新,随后正常微调模型。为实现双向更新,我们仅将训练样本从“src→tgt”重构为“src+tgt→tgt+src”,无需任何复杂的模型修改。值得注意的是,我们的方法不增加任何参数或训练步数,仅需平行数据。实验结果表明,BiT 在 8 个语言对上的 15 个翻译任务(数据规模从 160K 到 38M 不等)中将 SOTA 神经机器翻译性能显著提升。令人鼓舞的是,我们提出的模型可补充现有的数据操纵策略,即回译、数据蒸馏和数据多样化。大量分析表明,我们的方法充当了一种新颖的双语码切换器,获得了更好的双语对齐。

关键词

引用

@article{arxiv.2109.07780,
  title  = {Improving Neural Machine Translation by Bidirectional Training},
  author = {Liang Ding and Di Wu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2109.07780},
  year   = {2021}
}

备注

EMNLP 2021. arXiv admin note: text overlap with arXiv:2107.11572