中文

从SpokenVocab生成合成语音用于语音翻译

计算与语言 2023-02-09 v2 人工智能

摘要

训练端到端语音翻译(ST)系统需要足够大规模的数据,而对于大多数语言对和领域而言这类数据并不可用。解决数据稀缺问题的一个实用方案是通过文本到语音(TTS)系统将机器翻译(MT)数据转换为ST数据。然而,使用TTS系统可能繁琐且缓慢,因为需要对每个MT数据集进行转换。在本工作中,我们提出一种简单、可扩展且有效的数据增强技术,即SpokenVocab,用于即时将MT数据转换为ST数据。其思路是根据MT序列中的词从SpokenVocab库中检索并拼接音频片段。我们在Must-C的多个语言对上的实验表明,该方法以平均1.83个BLEU分数的优势优于强基线,并且其表现与TTS生成的语音相当。我们还展示了SpokenVocab如何应用于代码切换ST,而此类任务通常不存在TTS系统。我们的代码可在https://github.com/mingzi151/SpokenVocab获取。

关键词

引用

@article{arxiv.2210.08174,
  title  = {Generating Synthetic Speech from SpokenVocab for Speech Translation},
  author = {Jinming Zhao and Gholamreza Haffar and Ehsan Shareghi},
  journal= {arXiv preprint arXiv:2210.08174},
  year   = {2023}
}

备注

EACL2023-Finding