中文

基于 Parallel WaveNet 的通用神经声码器

音频与语音处理 2021-02-16 v2 计算与语言 声音

摘要

我们提出一种基于 Parallel WaveNet 的通用神经声码器,带有一个称为 Audio Encoder 的附加条件网络。我们的通用声码器在广泛的用例上提供实时高质量语音合成。我们在 43 位年龄与性别各异的内部说话人上进行了测试,其使用 17 种独特风格讲 20 种语言,其中 7 个嗓音与 5 种风格在训练期间未出现过。我们表明所提出的通用声码器总体上显著优于说话人相关声码器。我们还表明所提出的声码器在自然度与通用性方面优于若干现有神经声码器架构。当我们进一步在 300 多个开源嗓音上测试时,这些发现保持一致。

关键词

引用

@article{arxiv.2102.01106,
  title  = {Universal Neural Vocoding with Parallel WaveNet},
  author = {Yunlong Jiao and Adam Gabrys and Georgi Tinchev and Bartosz Putrycz and Daniel Korzekwa and Viacheslav Klimkov},
  journal= {arXiv preprint arXiv:2102.01106},
  year   = {2021}
}

备注

5 pages, 2 figures. Accepted to ICASSP 2021