中文

基于生成对抗网络的说话人自适应以实现高保真WaveNet声码器

音频与语音处理 2019-07-22 v2 声音

摘要

尽管最先进的并行WaveNet已解决实时波形生成问题,仍存在若干不足。首先,由于模型的含噪输入信号,生成波形与自然波形的质量之间仍有差距。其次,并行WaveNet在蒸馏框架下训练,使得将训练良好的模型自适应到新说话人十分繁琐。为解决这两个问题,本文提出一种基于生成对抗网络(GAN)的端到端自适应方法,可降低新说话人自适应训练的计算成本。我们的主观实验显示,所提训练方法能进一步缩小生成与自然波形之间的质量差距。

关键词

引用

@article{arxiv.1812.02339,
  title  = {Generative Adversarial Network based Speaker Adaptation for High Fidelity WaveNet Vocoder},
  author = {Qiao Tian and Xucheng Wan and Shan Liu},
  journal= {arXiv preprint arXiv:1812.02339},
  year   = {2019}
}

备注

5 pages, 4 figure, 1 table, 6 equations