基于学习度量的神经机器翻译奖励优化
计算与语言
2021-04-16 v1 机器学习
摘要
神经机器翻译(NMT)模型通常以词符级负对数似然(NLL)进行训练,这并不能保证生成的译文针对所选序列级评测度量进行优化。已有多种方法提出以 BLEU 作为奖励来训练 NMT,以直接提升该度量。然而,据报道 BLEU 的提升并未转化为真实质量的改进,限制了其在工业中的应用。近来,学界已明确,在处理最先进模型时,BLEU 与人类判断的相关性较低。这导致了基于模型的评测度量的出现。这些新度量被证明具有更高的人类相关性。在本文中,我们研究利用最先进的基于模型的度量 BLEURT 来优化 NMT 模型是否有益。我们提出了一种对比边际损失(contrastive-margin loss),用于适合大型 NMT 模型的快速且稳定的奖励优化。在实验中,我们执行自动和人工评估,将使用平滑 BLEU 和 BLEURT 训练的模型与基线模型进行比较。结果表明,与采用平滑 BLEU 训练时有限的提升相比,使用 BLEURT 的奖励优化能够大幅提高度量分数。人工评估显示,使用 BLEURT 训练的模型改善了译文的充分性与覆盖度。代码可通过 https://github.com/naver-ai/MetricMT 获取。
引用
@article{arxiv.2104.07541,
title = {Reward Optimization for Neural Machine Translation with Learned Metrics},
author = {Raphael Shu and Kang Min Yoo and Jung-Woo Ha},
journal= {arXiv preprint arXiv:2104.07541},
year = {2021}
}