从SpokenVocab生成合成语音用于语音翻译
计算与语言
2023-02-09 v2 人工智能
摘要
训练端到端语音翻译(ST)系统需要足够大规模的数据,而对于大多数语言对和领域而言这类数据并不可用。解决数据稀缺问题的一个实用方案是通过文本到语音(TTS)系统将机器翻译(MT)数据转换为ST数据。然而,使用TTS系统可能繁琐且缓慢,因为需要对每个MT数据集进行转换。在本工作中,我们提出一种简单、可扩展且有效的数据增强技术,即SpokenVocab,用于即时将MT数据转换为ST数据。其思路是根据MT序列中的词从SpokenVocab库中检索并拼接音频片段。我们在Must-C的多个语言对上的实验表明,该方法以平均1.83个BLEU分数的优势优于强基线,并且其表现与TTS生成的语音相当。我们还展示了SpokenVocab如何应用于代码切换ST,而此类任务通常不存在TTS系统。我们的代码可在https://github.com/mingzi151/SpokenVocab获取。
引用
@article{arxiv.2210.08174,
title = {Generating Synthetic Speech from SpokenVocab for Speech Translation},
author = {Jinming Zhao and Gholamreza Haffar and Ehsan Shareghi},
journal= {arXiv preprint arXiv:2210.08174},
year = {2023}
}
备注
EACL2023-Finding