中文

ACES:WMT 2023 上的翻译准确性挑战集

计算与语言 2023-11-03 v1

摘要

我们使用 ACES 挑战集(Amrhein 等人,2022)对提交至 WMT 2023 的句段级指标进行了性能基准测试。该挑战集包含 36K 个样本,代表了来自 68 种语言现象的难题,覆盖 146 个语言对。这些现象涵盖从词/字符层面的简单扰动,到基于语篇和真实世界知识的更复杂错误。针对每个指标,我们提供了其在一系列错误类别上的详细性能画像,以及用于快速对比的总体 ACES 分数。我们还度量了提交至 WMT 2023 与 2022 的指标的相对增量性能。我们发现:1)提交至 WMT 2023 的各指标间无明显胜出者;2)这些指标在 2023 与 2022 版本间的性能变化高度不稳定。我们的建议与 WMT 2022 类似:指标开发者应聚焦于:构建来自不同设计族的指标集成,开发更关注源语言、更少依赖表层重叠的指标,并仔细确定多语言嵌入对机器翻译评测的影响。

关键词

引用

@article{arxiv.2311.01153,
  title  = {ACES: Translation Accuracy Challenge Sets at WMT 2023},
  author = {Chantal Amrhein and Nikita Moghe and Liane Guillou},
  journal= {arXiv preprint arXiv:2311.01153},
  year   = {2023}
}

备注

Camera Ready WMT 2023. arXiv admin note: text overlap with arXiv:2210.15615