UWSpeech:面向无文字语言的语音到语音翻译
音频与语音处理
2020-12-18 v2 计算与语言
摘要
现有的语音到语音翻译系统严重依赖目标语言的文本:它们通常先将源语言翻译为目标文本,然后从文本合成目标语音,或直接翻译为目标语音,同时使用目标文本进行辅助训练。然而,这些方法无法应用于没有书面文本或音素可用的无文字目标语言。本文中,我们开发了一个面向无文字语言的翻译系统,名为UWSpeech,该系统通过转换器将目标无文字语音转换为离散令牌,然后通过翻译器将源语言语音翻译为目标离散令牌,最后通过逆变器从目标离散令牌合成目标语音。我们提出一种称为XL-VAE的方法,该方法利用跨语言(XL)语音识别增强矢量量化变分自编码器(VQ-VAE),以联合训练UWSpeech的转换器和逆变器。在Fisher西班牙语-英语对话翻译数据集上的实验表明,UWSpeech分别比直接翻译和VQ-VAE基线高出约16和10个BLEU点,这证明了UWSpeech的优势和潜力。
引用
@article{arxiv.2006.07926,
title = {UWSpeech: Speech to Speech Translation for Unwritten Languages},
author = {Chen Zhang and Xu Tan and Yi Ren and Tao Qin and Kejun Zhang and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2006.07926},
year = {2020}
}