中文

评估IWSLT2023语音翻译任务:人工标注、自动指标和分割

计算与语言 2024-06-07 v1

摘要

人工评估是机器翻译系统开发中的关键组成部分,并且在文本翻译研究中受到了广泛关注。然而,关于语音翻译人工评估的先前工作很少,这增加了额外的挑战,例如噪声数据和分割不匹配。我们迈出了填补这一空白的第一步,对来自上一届国际口语语言翻译研讨会(IWSLT 2023)的多个共享任务的结果进行了全面的人工评估。我们提出了一种基于自动重分割和带片段上下文的直接评估的有效评估策略。我们的分析揭示:1)所提出的评估策略是稳健的,并且得分与其他类型的人工判断具有良好的相关性;2)自动指标通常(但并非总是)与直接评估得分具有良好的相关性;3)COMET作为比chrF稍强的自动指标,尽管重分割步骤系统引入了分割噪声。我们发布了收集到的人工标注数据,以鼓励进一步的研究。

关键词

引用

@article{arxiv.2406.03881,
  title  = {Evaluating the IWSLT2023 Speech Translation Tasks: Human Annotations, Automatic Metrics, and Segmentation},
  author = {Matthias Sperber and Ondřej Bojar and Barry Haddow and Dávid Javorský and Xutai Ma and Matteo Negri and Jan Niehues and Peter Polák and Elizabeth Salesky and Katsuhito Sudoh and Marco Turchi},
  journal= {arXiv preprint arXiv:2406.03881},
  year   = {2024}
}

备注

LREC-COLING2024 publication (with corrections for Table 3)