中文

音素特征改进语音翻译

计算与语言 2020-05-29 v1 声音 音频与语音处理

摘要

语音翻译(ST)的端到端模型比传统的语音识别(ASR)与机器翻译(MT)级联模型更紧密地耦合了 ASR 和 MT,具有更简单的模型架构并有可能减少错误传播。人们通常认为其性能更优,但在许多条件下这尚未成为现实。我们在高、中、低资源条件下比较了级联模型与端到端模型,并表明级联模型仍是更强的基线。此外,我们引入了两种将音素特征融入 ST 模型的方法。我们表明这些特征改进了两种架构,缩小了端到端模型与级联模型之间的差距,并优于以往的学术工作——在我们的低资源设定下最高提升 9 BLEU。

关键词

引用

@article{arxiv.2005.13681,
  title  = {Phone Features Improve Speech Translation},
  author = {Elizabeth Salesky and Alan W Black},
  journal= {arXiv preprint arXiv:2005.13681},
  year   = {2020}
}

备注

Accepted to ACL2020