中文

评估神经机器翻译系统对语音识别错误的容忍度

计算与语言 2019-04-26 v1

摘要

机器翻译系统传统上在文本资源上训练,这些资源并不建模口语中出现的语言现象。尽管文献中积极研究了神经机器翻译系统在文本输入上的评估,但对于用神经模型翻译口语数据的复杂性所知甚少。我们引入并阐明了在考虑神经机器翻译(NMT)系统对自动语音识别(ASR)输出进行翻译时所面临的若干有趣问题。我们测试了用于 NMT 编码器-解码器建模的句子编码方法的鲁棒性,重点关注基于词而非字节对编码的方式。我们将最先进 NMT 编码器-解码器系统对含 ASR 错误的语句的翻译与一个强基线短语机器翻译进行比较,以更好理解 ASR 输出中哪些现象在 NMT 框架下比将翻译表示为线性模型的方法得到更好的表征。

关键词

引用

@article{arxiv.1904.10997,
  title  = {Assessing the Tolerance of Neural Machine Translation Systems Against Speech Recognition Errors},
  author = {Nicholas Ruiz and Mattia Antonino Di Gangi and Nicola Bertoldi and Marcello Federico},
  journal= {arXiv preprint arXiv:1904.10997},
  year   = {2019}
}

备注

Interspeech 2017