防止神经机器翻译中的语言模型过度自信
计算与语言
2021-06-01 v2 人工智能
摘要
神经机器翻译(NMT)模型本质上是一个以源句子和部分译文为条件的联合语言模型(LM)。因此,NMT模型天然包含了仅基于部分译文预测下一个词符的LM机制。尽管取得了成功,NMT仍受幻觉问题困扰,生成流畅但不充分的翻译。其主要原因是NMT过度关注部分译文,而在一定程度上忽视了源句子,即LM的过度自信。据此,我们定义了NMT与LM之间的边际(Margin),通过对每个词符用NMT模型的预测概率减去LM的预测概率来计算。该边际与LM的过度自信程度负相关。基于该性质,我们提出了基于边际的词级目标(MTO)和基于边际的句子级目标(MSO),以最大化边际,从而防止LM过度自信。在WMT14英德、WMT19中英和WMT14英法翻译任务上的实验证明了我们方法的有效性,相比Transformer基线分别取得了1.36、1.50和0.63的BLEU提升。人工评估进一步验证了我们的方法提升了翻译的充分性与流畅性。
引用
@article{arxiv.2105.11098,
title = {Prevent the Language Model from being Overconfident in Neural Machine Translation},
author = {Mengqi Miao and Fandong Meng and Yijin Liu and Xiao-Hua Zhou and Jie Zhou},
journal= {arXiv preprint arXiv:2105.11098},
year = {2021}
}
备注
Accepted as a long paper at ACL 2021. Code is available at: https://github.com/Mlair77/nmt_adequacy