中文

利用跨语言语音转换构建多语言 TTS

音频与语音处理 2020-12-29 v1 声音

摘要

本文提出一种新的跨语言语音转换(VC)方法,该方法利用多个 ASR 声学模型从输入语音中提取 PPG(音素后验图,Phonetic PosteriorGrams),通过一个 DNN 模型生成所有语音参数(MCEP、LF0、BAP)。使用所提出的 VC 方法,我们尝试了三种不同的方法来构建多语言 TTS 系统而无需录制多语言语音语料库。进行了听感测试以评估转换语音与目标语音之间的语音质量(自然度)和说话人相似度。结果表明,方法 1 达到了最高自然度(5 分制下 3.28 MOS)和相似度(2.77 MOS)。

关键词

引用

@article{arxiv.2012.14039,
  title  = {Building Multi lingual TTS using Cross Lingual Voice Conversion},
  author = {Qinghua Sun and Kenji Nagamatsu},
  journal= {arXiv preprint arXiv:2012.14039},
  year   = {2020}
}