中文

基于音频的众包机器翻译质量评估

计算与语言 2025-09-18 v1 人机交互

摘要

机器翻译(MT)已取得显著进展, speech translation 与多模态方法受到广泛关注。然而尽管已有进展,MT 质量评估仍主要基于文本,通常依赖阅读并比较文本的人类专家。由于许多实际应用(如 Google Translate Voice Mode、iFLYTEK Translator)涉及翻译内容为语音而非文本,更自然的质量评估方式应通过语音进行而非仅文本评估。本研究比较了 10 个来自 WMT General MT Shared Task 的 MT 系统的文本评估与音频评估,采用 Amazon Mechanical Turk 进行众包评判。我们此外进行统计显著性测试和自复制实验,以检验音频方法的可靠性与一致性。基于音频的众包评估结果与文本评估基本一致,但在某些情况下识别出显著差异。我们认为这源于语音更丰富、更自然的模态,提出在未来 MT 评估框架中纳入语音评估。

关键词

引用

@article{arxiv.2509.14023,
  title  = {Audio-Based Crowd-Sourced Evaluation of Machine Translation Quality},
  author = {Sami Ul Haq and Sheila Castilho and Yvette Graham},
  journal= {arXiv preprint arXiv:2509.14023},
  year   = {2025}
}

备注

Accepted at WMT2025 (ENNLP) for oral presented