ACES:用于评估机器翻译指标的翻译准确性挑战集
计算与语言
2022-12-07 v2
摘要
随着机器翻译(MT)指标每年与其人类判断的相关性不断提高,理解此类指标在句段层面的局限性至关重要。具体而言,调查指标在面对 MT 中准确性错误时的行为十分重要,因为这些错误在特定语境(例如法律、医学)下可能带来危险后果。我们整理了 ACES,一个翻译准确性挑战集,包含从词/字符层面的简单扰动到基于话语和真实世界知识的更复杂错误在内的 68 种现象。我们使用 ACES 评估了广泛的 MT 指标,包括提交至 WMT 2022 指标共享任务的成果,并进行了若干分析以得出面向指标开发者的一般性建议。我们建议:a) 结合具有不同优势的 metrics,b) 开发更重视源语、较少重视与参考译文表层重叠的指标,c) 显式建模超越多语嵌入所能提供信息的额外语言特定信息。
引用
@article{arxiv.2210.15615,
title = {ACES: Translation Accuracy Challenge Sets for Evaluating Machine Translation Metrics},
author = {Chantal Amrhein and Nikita Moghe and Liane Guillou},
journal= {arXiv preprint arXiv:2210.15615},
year = {2022}
}
备注
preprint for WMT 2022 with updated tables