中文

多源机器翻译对转写错误的鲁棒性

计算与语言 2023-05-29 v1

摘要

自动语音翻译对语音识别错误十分敏感,但在多语言场景下,相同内容可通过同声传译、配音或字幕以多种语言获取。在本文中,我们假设如果多个源所包含的正确信息能够相互补充,则利用多源将提升翻译质量。为此,我们首先在 10 小时的 ESIC 语料库上表明,原始英语语音中的 ASR 错误及其德语和捷克语同声传译中的 ASR 错误是相互独立的。然后,我们在多源设定下使用英语和德语两个源翻译为捷克语,以确立其对 ASR 错误的鲁棒性。此外,我们在同声翻译设定下同时翻译两个含噪源时也观察到了这种鲁棒性。我们的结果表明,多源神经机器翻译有潜力在实时同声翻译场景中发挥作用,从而推动该领域的进一步研究。

关键词

引用

@article{arxiv.2305.16894,
  title  = {Robustness of Multi-Source MT to Transcription Errors},
  author = {Dominik Macháček and Peter Polák and Ondřej Bojar and Raj Dabre},
  journal= {arXiv preprint arXiv:2305.16894},
  year   = {2023}
}

备注

ACL 2023 Findings