中文

DEMETR:面向机器翻译评估指标的诊断

计算与语言 2022-10-26 v1

摘要

尽管基于字符串重叠的机器翻译评估指标(如BLEU)存在局限,但其计算过程透明:分配给特定候选译文的BLEU分数可追溯到某些词的出现与否。相较之下,较新的学习型指标(如BLEURT、COMET)利用预训练语言模型实现了比BLEU更高的人类质量判断相关性,但其运作不透明。本文通过构建DEMETR来揭示这些学习型指标的行为,DEMETR是一个包含31K英语样本(译自10种源语言)的诊断数据集,用于评估机器翻译评估指标对跨越语义、句法和形态错误类别的35种不同语言扰动的敏感性。所有扰动均经过精心设计,以与实际译文构成最小对(即仅在一个方面不同)。我们发现学习型指标在DEMETR上的表现显著优于基于字符串的指标。此外,学习型指标对不同现象的敏感性存在差异(例如BERTScore对未翻译词敏感但对性别操纵相对不敏感,而COMET对词语重复远比体貌变化敏感)。我们公开发布DEMETR,以推动未来更具针对性的机器翻译评估指标开发。

关键词

引用

@article{arxiv.2210.13746,
  title  = {DEMETR: Diagnosing Evaluation Metrics for Translation},
  author = {Marzena Karpinska and Nishant Raj and Katherine Thai and Yixiao Song and Ankita Gupta and Mohit Iyyer},
  journal= {arXiv preprint arXiv:2210.13746},
  year   = {2022}
}

备注

22 pages, EMNLP 2022 (camera ready)