中文

一对多的多语言端到端语音翻译

计算与语言 2019-10-09 v1 音频与语音处理

摘要

如今,训练用于口语语言翻译(SLT)的端到端神经模型仍须应对极端的数据稀缺状况。现有的 SLT 平行语料库确实比密切相关的自动语音识别(ASR)和机器翻译(MT)任务可用的语料库小数个数量级,后两者通常包含数千万实例。为应对数据匮乏,本文通过提出一种多语言方法来探索端到端 SLT 中迁移学习的有效性。多语言方案在 MT 中被广泛研究,通常依赖于“\textit{目标强制}”,即将多语言平行数据合并,通过在输入序列前附加指定目标语言的语言标记来训练单一模型。然而,在语音翻译中测试时,我们的实验表明,照原样使用的类 MT \textit{目标强制} 在区分目标语言方面并不有效。因此,我们提出一种变体,利用目标语言嵌入根据语言将输入表示偏移至空间的不同部分,从而更好地支持以所需目标语言生成输出。我们从英语到六种语言的端到端 SLT 实验显示,在翻译为相似语言时取得重要改进,尤其当这些语言仅有稀缺数据支持时。当使用英语 ASR 数据作为附加语言时获得进一步改进(高达 +2.5+2.5 个 BLEU 点)。

关键词

引用

@article{arxiv.1910.03320,
  title  = {One-To-Many Multilingual End-to-end Speech Translation},
  author = {Mattia Antonino Di Gangi and Matteo Negri and Marco Turchi},
  journal= {arXiv preprint arXiv:1910.03320},
  year   = {2019}
}

备注

8 pages, one figure, version accepted at ASRU 2019