自动评估指标能否评估高质量翻译?
计算与语言
2024-10-11 v2
摘要
自动评估指标通常通过衡量其与人类评估之间的相关性来进行验证。然而,相关性方法往往只捕捉指标区分良好与差的 source-translation 对的能力,忽略其在区分同一 source 的备选翻译可靠性方面的表现。在本文中,我们通过展示当前指标对翻译质量细微差异不敏感的事实来证明这一点。这一现象在翻译质量较高且备选方案之间的差异较小时尤为突出。鉴于此,我们转向检测高质量正确翻译,这是实际决策场景中一个重要问题,在此场景下,二元正确性检查优先于对质量的细致评估。以 MQM 框架作为金标准,我们系统性地检验了当前指标识别人类标记无错误翻译的能力。我们的发现表明,当前指标常常高估或低估翻译质量,表明在自动评估方法方面仍有很大的改进空间。
引用
@article{arxiv.2405.18348,
title = {Can Automatic Metrics Assess High-Quality Translations?},
author = {Sweta Agrawal and António Farinhas and Ricardo Rei and André F. T. Martins},
journal= {arXiv preprint arXiv:2405.18348},
year = {2024}
}
备注
Accepted at EMNLP Main 2024