通过翻译准确性挑战集进行机器翻译元评估
计算与语言
2024-01-30 v1
摘要
最近的机器翻译(MT)指标通过将其与人类判断相关联来校准其有效性,但并未揭示其在不同错误类型上的行为。挑战集被用来探测指标行为的特定维度,但此类数据集非常少,并且它们要么关注有限数量的现象,要么关注有限数量的语言对。我们引入了ACES,一个涵盖146个语言对的对比性挑战集,旨在发现指标是否能识别68种翻译准确性错误。这些现象范围从词/字符级别的简单更改到基于语篇和现实世界知识的更复杂错误。我们通过在提交给WMT 2022和2023指标共享任务的50个指标上对ACES进行基准测试,进行了一项大规模研究。我们对指标性能进行了基准测试,评估了它们在连续活动中的增量性能,并测量了它们对一系列语言现象的敏感性。我们还通过在ACES上进行评估,研究了大语言模型(LLMs)作为MT评估器有效性的说法。我们的结果表明,不同的指标家族在不同的现象上表现困难,并且基于LLM的方法未能展示出可靠的性能。我们的分析表明,大多数指标忽略了源语句,倾向于表面级别的重叠,并最终融入了基础模型的特性,而这些特性并非总是有益的。我们将ACES扩展为包含错误跨度标注,记为SPAN-ACES,并使用该数据集评估了基于跨度的错误指标,表明这些指标也需要相当大的改进。最后,我们提供了一套构建更好MT指标的建议,包括关注错误标签而非分数、集成、设计明确关注源语句的策略、关注语义内容以及选择正确的基础模型进行表示。
引用
@article{arxiv.2401.16313,
title = {Machine Translation Meta Evaluation through Translation Accuracy Challenge Sets},
author = {Nikita Moghe and Arnisa Fazla and Chantal Amrhein and Tom Kocmi and Mark Steedman and Alexandra Birch and Rico Sennrich and Liane Guillou},
journal= {arXiv preprint arXiv:2401.16313},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2210.15615