中文

利用无监督与弱监督数据改进端到端语音到语音翻译

计算与语言 2022-06-29 v2 机器学习 声音 音频与语音处理

摘要

不依赖中间文本表示的端到端语音到语音翻译(S2ST)是一个迅速兴起的研究前沿。近期工作表明,当在可比数据集上训练时,此类直接S2ST系统的性能正接近传统的级联S2ST。然而在实践中,直接S2ST的性能受限于成对S2ST训练数据的可用性。在本工作中,我们探索了多种利用更广泛可用的无监督和弱监督语音与文本数据来改进基于Translatotron 2的直接S2ST性能的方法。采用我们最有效的方法,在CVSS-C语料库上21个语言对的直接S2ST平均翻译质量相比此前未使用额外数据训练的state-of-the-art提升了+13.6 BLEU(或相对+113%)。在低资源语言上的提升更为显著(平均相对+398%)。我们的对比研究为S2ST与语音表示学习的未来研究方向提供了建议。

关键词

引用

@article{arxiv.2203.13339,
  title  = {Leveraging unsupervised and weakly-supervised data to improve direct speech-to-speech translation},
  author = {Ye Jia and Yifan Ding and Ankur Bapna and Colin Cherry and Yu Zhang and Alexis Conneau and Nobuyuki Morioka},
  journal= {arXiv preprint arXiv:2203.13339},
  year   = {2022}
}

备注

Interspeech 2022