中文

XQ-MEval:用于评估翻译指标的跨语言平行质量数据集

计算与语言 2026-04-21 v2

摘要

自动评估指标是构建多语言翻译系统的必备工具。常见的评估做法是对不同语言的指标得分进行平均,但这种做法可能存在跨语言评分偏差,即相同质量的翻译在不同语言上获得不同的得分。由于缺乏提供跨语言平行质量实例的基准数据集,且专家标注不可行,这一问题一直未被系统研究。在本工作中,我们提出XQ-MEval,一个覆盖九种翻译方向的半自动构建数据集,用于评估翻译指标。具体而言,我们自动注入MQM定义的错误到金标准翻译中,通过母语者筛选确保可靠性,并合并错误以生成可控质量的伪翻译。这些伪翻译随对应的源文本和参考译文组成三元组,用于评估翻译指标的质量。借助XQ-MEval,我们对九个代表性指标进行实验,发现平均值与人类判断之间存在不一致,首次提供跨语言评分偏差的实证证据。最后,我们提出一种源自XQ-MEval的归一化策略,使不同语言的得分分布对齐,提高了多语言评估的公平性和可靠性。

关键词

引用

@article{arxiv.2604.14934,
  title  = {XQ-MEval: A Dataset with Cross-lingual Parallel Quality for Benchmarking Translation Metrics},
  author = {Jingxuan Liu and Zhi Qu and Jin Tei and Hidetaka Kamigaito and Lemao Liu and Taro Watanabe},
  journal= {arXiv preprint arXiv:2604.14934},
  year   = {2026}
}

备注

19 pages, 8 figures, ACL 2026 Findings