中文

用于神经机器翻译的可控双偏斜散度损失

计算与语言 2021-04-20 v2

摘要

在神经机器翻译等序列预测任务中,使用交叉熵损失训练常导致模型过度泛化并陷入局部最优。本文提出一种扩展损失函数,称为“双偏斜散度 (dual skew divergence, DSD)”,它以平衡权重整合 KL 散度上的两个对称项。我们通过实验发现,这种平衡权重在将所提出的 DSD 损失应用于深度模型中起着关键作用。因此,我们最终开发出一种适用于通用场景的可控 DSD 损失。实验表明,在最大似然训练收敛后切换至 DSD 损失有助于模型逃离局部最优,并促进稳定的性能提升。我们在 WMT 2014 英德和英法翻译任务上的评估证明,所提出的损失作为一种通用且便捷的 NMT 训练手段,确实相比强基线带来了性能改进。

关键词

引用

@article{arxiv.1908.08399,
  title  = {Controllable Dual Skew Divergence Loss for Neural Machine Translation},
  author = {Zuchao Li and Hai Zhao and Yingting Wu and Fengshun Xiao and Shu Jiang},
  journal= {arXiv preprint arXiv:1908.08399},
  year   = {2021}
}