Otem 与 Utem:面向神经机器翻译的过译与漏译评价指标
计算与语言
2018-07-25 v1
摘要
尽管神经机器翻译(NMT)取得了令人满意的翻译性能,其不幸受困于过译与漏译问题 [Tu et al., 2016],相关研究已成为 NMT 中的研究热点。目前,这些研究主要应用主流的自动评价指标(如 BLEU)来从充分性与流畅性两方面评估整体翻译质量。然而,它们无法准确衡量 NMT 系统处理上述问题的能力。在本文中,我们提出两个定量指标 Otem 和 Utem,分别自动评估系统在过译与漏译方面的表现。两个指标均基于黄金参考与系统译文之间不匹配 n-gram 的比例。我们通过将指标得分与人类评估比较来评估二者,其中皮尔逊相关系数的值显示出它们的强相关性。此外,对多种翻译系统的深入分析表明 BLEU 与我们提出的指标之间存在某些不一致,凸显了我们指标的必要性与重要性。
引用
@article{arxiv.1807.08945,
title = {Otem&Utem: Over- and Under-Translation Evaluation Metric for NMT},
author = {Jing Yang and Biao Zhang and Yue Qin and Xiangwen Zhang and Qian Lin and Jinsong Su},
journal= {arXiv preprint arXiv:1807.08945},
year = {2018}
}