基于音频的众包机器翻译质量评估
计算与语言
2025-09-18 v1 人机交互
摘要
机器翻译(MT)已取得显著进展, speech translation 与多模态方法受到广泛关注。然而尽管已有进展,MT 质量评估仍主要基于文本,通常依赖阅读并比较文本的人类专家。由于许多实际应用(如 Google Translate Voice Mode、iFLYTEK Translator)涉及翻译内容为语音而非文本,更自然的质量评估方式应通过语音进行而非仅文本评估。本研究比较了 10 个来自 WMT General MT Shared Task 的 MT 系统的文本评估与音频评估,采用 Amazon Mechanical Turk 进行众包评判。我们此外进行统计显著性测试和自复制实验,以检验音频方法的可靠性与一致性。基于音频的众包评估结果与文本评估基本一致,但在某些情况下识别出显著差异。我们认为这源于语音更丰富、更自然的模态,提出在未来 MT 评估框架中纳入语音评估。
引用
@article{arxiv.2509.14023,
title = {Audio-Based Crowd-Sourced Evaluation of Machine Translation Quality},
author = {Sami Ul Haq and Sheila Castilho and Yvette Graham},
journal= {arXiv preprint arXiv:2509.14023},
year = {2025}
}
备注
Accepted at WMT2025 (ENNLP) for oral presented