中文

机器翻译元评估的守护者:哨兵指标登场!

计算与语言 2024-08-27 v1 人工智能

摘要

每年在机器翻译会议(WMT)上,指标共享任务组织者会对机器翻译(MT)指标的元评估进行评估,并根据其与人类判断之间的相关性对其进行排名。这些结果指导研究者致力于提升下一代指标和 MT 系统。尽管近期引入了神经指标,推动了该领域的显著进展,但其内在的不透明性已对元评估过程提出了巨大挑战。本工作指出了当前 WMT 元评估框架中的两个问题,并评估了其对指标排名的影响。为此,我们提出哨兵指标(sentinel metrics)的概念,这些指标旨在专门审查元评估过程的准确性、稳健性和公平性。通过运用哨兵指标,我们旨在验证我们的发现,揭示并监控排名中潜在的偏差或不一致性。我们发现,当前的元评估框架偏好两类指标:i)明确训练以模拟人类质量评估的指标;ii)连续型指标。最后,我们对最新 MT 指标的评估能力提出疑虑,强调它们可能是基于其训练数据中发现的虚假相关性进行评估。

关键词

引用

@article{arxiv.2408.13831,
  title  = {Guardians of the Machine Translation Meta-Evaluation: Sentinel Metrics Fall In!},
  author = {Stefano Perrella and Lorenzo Proietti and Alessandro Scirè and Edoardo Barba and Roberto Navigli},
  journal= {arXiv preprint arXiv:2408.13831},
  year   = {2024}
}

备注

Presented at ACL 2024 Main Conference. 29 pages