发布还是不发布:机器翻译自动评估指标的全面评估
计算与语言
2021-09-15 v2
摘要
自动评估指标通常被用作宣告一个机器翻译系统质量优于另一个系统的唯一工具。自动评估指标的社区选择通过决定哪些模型被认为更好,引导了研究方向和工业界的发展。由于这些集合规模的限制,评估指标与多组人类判断之间的相关性一直受到制约。在本文中,据我们所知,基于文献中报道的最大规模判断集合,我们验证了指标与人类判断相比的可靠程度。可以说,两个系统的成对排序是研究或部署场景中最常见的评估任务。我们将人类判断作为黄金标准,研究了哪些指标在预测此类系统对的翻译质量排序方面具有最高的准确率。此外,我们评估了各种指标在不同语言对和领域上的表现。最后,我们表明,仅使用 BLEU 阻碍了改进模型的开发,导致了糟糕的部署决策。我们发布了包含 4380 个系统的 230 万条句子级人类判断集合,以供进一步分析和复现我们的工作。
引用
@article{arxiv.2107.10821,
title = {To Ship or Not to Ship: An Extensive Evaluation of Automatic Metrics for Machine Translation},
author = {Tom Kocmi and Christian Federmann and Roman Grundkiewicz and Marcin Junczys-Dowmunt and Hitokazu Matsushita and Arul Menezes},
journal= {arXiv preprint arXiv:2107.10821},
year = {2021}
}
备注
Accepted to WMT 2021 research papers