中文

基于源到目标直接映射的非并行语音转换

音频与语音处理 2020-06-15 v1

摘要

近期利用音素后验图(PPGs)进行非并行语音转换的工作显著提升了语音转换的可用性,因为源与目标数据库不再需要内容匹配。在该方法中,PPGs被用作源说话人与目标说话人特征之间的语言桥梁。然而,这种基于PPG的非并行语音转换存在局限:转换时需要两个级联网络,使其不太适合实时应用,且在转换阶段易受源说话人可懂度影响。为解决该局限,我们提出一种新的非并行语音转换技术,采用单一神经网络进行源到目标语音参数的直接映射。凭借该单网络结构,所提方法能减少转换时间与网络参数量,这在嵌入式或实时环境中尤为关键。此外,它通过跳过转换阶段的电话识别器提升了语音转换质量,可有效避免基于PPG的间接方法所遭受的音素信息可能损失。实验表明,相较原始基于PPG的方法,我们的方法将网络参数量与转换时间分别减少41.9%与44.5%,且提升了语音相似度。

关键词

引用

@article{arxiv.2006.06937,
  title  = {Non-parallel voice conversion based on source-to-target direct mapping},
  author = {Sunghee Jung and Youngjoo Suh and Yeunju Choi and Hoirin Kim},
  journal= {arXiv preprint arXiv:2006.06937},
  year   = {2020}
}

备注

Submitted to Interspeech 2019