纠缠于BLEU之中:重新评估自动机器翻译评估指标的评估
计算与语言
2020-06-15 v2
摘要
自动指标对于机器翻译系统的开发与评估至关重要。判断自动指标在何种程度上与人类评估这一黄金标准相一致并非一个直截了当的问题。我们表明,当前用于判断指标的方法对用于评估的译文高度敏感,尤其是离群值的存在,这常常导致关于指标有效性的过度自信的结论。最后,我们转向成对系统排序,开发了一种方法,用于将自动指标下的性能提升与人类判断进行阈值比较,从而可以量化所犯的一类与二类错误,即被接受的系统质量上不显著的人类差异,以及被拒绝的显著人类差异。这些发现共同表明,机器翻译中指标评估与系统性能评估的协议有待改进。
引用
@article{arxiv.2006.06264,
title = {Tangled up in BLEU: Reevaluating the Evaluation of Automatic Machine Translation Evaluation Metrics},
author = {Nitika Mathur and Timothy Baldwin and Trevor Cohn},
journal= {arXiv preprint arXiv:2006.06264},
year = {2020}
}
备注
Accepted at ACL 2020