IndicMT Eval:用于印度语言机器翻译指标元评估的数据集
计算与语言
2023-07-04 v2
摘要
机器翻译(MT)系统的快速增长使得对所用评估指标进行元评估的综合研究成为必要,这有助于更好地选择最能反映 MT 质量的指标。遗憾的是,多数研究聚焦于高资源语言(主要是英语),其观察结果未必适用于其他语言。印度语言拥有超过十亿使用者,在语言学上与英语不同,迄今尚无从英语到印度语言的 MT 系统评估的系统性研究。本文中,我们通过创建一个包含 7000 条细粒度标注的 MQM 数据集来填补这一空白,该数据集涵盖 5 种印度语言和 7 个 MT 系统,并用以建立标注者分数与现有自动指标所得分数间的相关性。我们的结果表明,COMET 等预训练指标与标注者分数的相关性最高。此外,我们发现这些指标未能充分捕捉印度语言中的流畅性错误,有必要开发专注于印度语言的指标。我们希望本数据集与分析能推动该领域的进一步研究。
引用
@article{arxiv.2212.10180,
title = {IndicMT Eval: A Dataset to Meta-Evaluate Machine Translation metrics for Indian Languages},
author = {Ananya B. Sai and Vignesh Nagarajan and Tanay Dixit and Raj Dabre and Anoop Kunchukuttan and Pratyush Kumar and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:2212.10180},
year = {2023}
}
备注
ACL 2023 long paper