中文

机器翻译中监督与无监督奖励的探索

计算与语言 2021-02-24 v1

摘要

强化学习(RL)是一个强大的框架,用于解决训练期间使用的损失函数与测试时所用最终评估指标之间的不一致问题。当应用于神经机器翻译(MT)时,它最小化了交叉熵损失与BLEU等不可微评估指标之间的失配。然而,这些指标作为训练时奖励函数的适用性值得怀疑:它们往往较为稀疏,并且偏向于参考文本中使用的特定词汇。我们提出通过两种方式使模型减少对此类指标的依赖来解决该问题:(a)采用熵正则化RL方法,不仅最大化奖励函数,还探索动作空间以避免峰值分布;(b)提出一种新颖的RL方法,探索动态无监督奖励函数以平衡探索与利用。我们的提案基于Soft Actor-Critic(SAC)框架,将离策最大熵模型适配于机器翻译等语言生成应用。我们证明,采用BLEU奖励的SAC倾向于更少过拟合训练数据,并在域外数据上表现更好。我们还表明,我们的动态无监督奖励能够带来歧义词的更好翻译。

关键词

引用

@article{arxiv.2102.11403,
  title  = {Exploring Supervised and Unsupervised Rewards in Machine Translation},
  author = {Julia Ive and Zixu Wang and Marina Fomicheva and Lucia Specia},
  journal= {arXiv preprint arXiv:2102.11403},
  year   = {2021}
}

备注

Long paper accepted to EACL 2021, Camera-ready version