中文

面向神经机器翻译的 token 级自适应训练

计算与语言 2020-10-12 v1

摘要

自然语言中存在着 token 不平衡现象,因为不同 token 出现的频率不同,这导致神经机器翻译(NMT)中不同 token 的学习难度不同。 vanilla NMT 模型通常对具有不同频率的目标 token 采用平凡的等权目标,并且相较于黄金 token 分布,倾向于生成更多高频 token 和更少低频 token。然而,低频 token 可能携带关键语义信息,一旦被忽视将影响翻译质量。在本文中,我们探索了基于 token 频率的目标 token 级自适应目标,以在训练期间为每个目标 token 分配适当权重。我们的目的是使那些有意义但相对低频的词在目标中被分配更大权重,以鼓励模型更多关注这些 token。我们的方法在 ZH-EN、EN-RO 和 EN-DE 翻译任务上取得了一致的翻译质量提升,尤其是在包含更多低频 token 的句子上,相较基线我们分别获得了 1.68、1.02 和 0.52 的 BLEU 提升。进一步分析表明,我们的方法还能改善翻译的词汇多样性。

关键词

引用

@article{arxiv.2010.04380,
  title  = {Token-level Adaptive Training for Neural Machine Translation},
  author = {Shuhao Gu and Jinchao Zhang and Fandong Meng and Yang Feng and Wanying Xie and Jie Zhou and Dong Yu},
  journal= {arXiv preprint arXiv:2010.04380},
  year   = {2020}
}

备注

12 pages; Accepted by EMNLP 2020