中文

基于能量的重排序:利用能量模型改进神经机器翻译

计算与语言 2021-09-22 v4 机器学习 机器学习

摘要

最大似然估计(MLE)与 BLEU 分数等任务度量之间的差异在自回归神经机器翻译(NMT)中已被研究,并催生了替代训练算法(Ranzato et al., 2016; Norouzi et al., 2016; Shen et al., 2016; Wu et al., 2018)。然而,由于其计算效率和稳定性,MLE 训练仍是自回归 NMT 的事实标准方法。尽管训练目标与任务度量之间存在这种不匹配,我们注意到从基于 MLE 训练的 NMT 中抽取的样本支持期望的分布——其中存在比束搜索解码输出 BLEU 分数高得多的样本。为利用这一观察,我们训练一个基于能量的模型来模仿任务度量的行为(即基于能量的模型对具有更高 BLEU 分数的样本赋予更低能量),这产生了一种基于从 NMT 抽取样本的重排序算法:基于能量的重排序(EBR)。我们使用边缘能量模型(在目标句子上)和联合能量模型(在源句和目标句上)。我们的带有联合能量模型的 EBR 持续提升了基于 Transformer 的 NMT 性能:IWSLT'14 德英任务上 +4 BLEU 点,僧伽罗语-英语上 +3.0 BLEU 点,WMT'16 英德任务上 +1.2 BLEU。

关键词

引用

@article{arxiv.2009.13267,
  title  = {Energy-Based Reranking: Improving Neural Machine Translation Using Energy-Based Models},
  author = {Sumanta Bhattacharyya and Amirmohammad Rooshenas and Subhajit Naskar and Simeng Sun and Mohit Iyyer and Andrew McCallum},
  journal= {arXiv preprint arXiv:2009.13267},
  year   = {2021}
}