中文

基于神经 TTS 模型与音素后验图的自然可控跨语言语音转换

声音 2021-02-04 v1 机器学习 音频与语音处理

摘要

跨语言语音转换(VC)是一个重要且具挑战性的问题,其源于不同语言音素集与语音韵律的显著失配。本文基于神经文本转语音(TTS)模型 FastSpeech 与 LPCNet 神经声码器,设计了一种名为 FastSpeech-VC 的新跨语言 VC 框架。我们通过应用已被证明可跨越说话人与语言边界的音素后验图(Phonetic PosteriorGrams, PPGs)来解决音素集与语音韵律的失配。此外,我们加入归一化对数尺度基频(Log-F0)以进一步补偿韵律失配并显著提升自然度。我们在英语与普通话上的实验表明,仅使用单语语料,所提 FastSpeech-VC 即可获得高质量转换语音,其平均意见得分(MOS)接近专业录音,同时保持良好说话人相似度。与使用 Tacotron2 与 Transformer TTS 模型的基线相比,FastSpeech-VC 可实现可控的转换语速与快得多的推理速度。更重要的是,FastSpeech-VC 可轻松适配于仅含有限训练语句的说话人。

关键词

引用

@article{arxiv.2102.01991,
  title  = {Towards Natural and Controllable Cross-Lingual Voice Conversion Based on Neural TTS Model and Phonetic Posteriorgram},
  author = {Shengkui Zhao and Hao Wang and Trung Hieu Nguyen and Bin Ma},
  journal= {arXiv preprint arXiv:2102.01991},
  year   = {2021}
}

备注

5 pages, 2 figures, 4 tables, accepted by ICASSP 2021