中文

通过无标签文本改进语音到语音翻译

计算与语言 2022-10-27 v1 声音 音频与语音处理

摘要

由于 S2ST 数据的严重稀缺,直接语音到语音翻译(S2ST)是翻译范式中最具挑战性的问题之一。尽管已有研究通过级联预训练的语音识别(ASR)、机器翻译(MT)和文本到语音(TTS)模型来增加来自无标签语音的数据规模,但无标签文本在改进 S2ST 方面的利用仍然相对不足。我们提出了一种有效的方法,通过对生成的合成数据应用各种声学效应,利用来自不同语言的海量现有无标签文本创建大量 S2ST 数据,以提升 S2ST 性能。在实验中,我们的方法在西班牙语-英语翻译上比现有最优方法高出最多 2 BLEU。在西班牙语-英语和俄语-英语翻译的极低资源设置下,进一步证明了该方法带来的显著增益。

关键词

引用

@article{arxiv.2210.14514,
  title  = {Improving Speech-to-Speech Translation Through Unlabeled Text},
  author = {Xuan-Phi Nguyen and Sravya Popuri and Changhan Wang and Yun Tang and Ilia Kulikov and Hongyu Gong},
  journal= {arXiv preprint arXiv:2210.14514},
  year   = {2022}
}