中文

使用基音同步多尺度生成对抗网络进行文本到语音合成的波形生成

音频与语音处理 2018-10-31 v1 声音 机器学习

摘要

由于 WaveNet 等新型神经波形生成方法,文本到语音合成的最先进水平近来得到显著改善。然而,这些方法受限于其缓慢的序列推理过程,而其并行版本难以训练且计算开销更大。与此同时,生成对抗网络(GANs)在图像生成中已取得令人印象深刻的成果,并正进入音频应用;并行推理正是其诱人特性之一。通过采用 GAN 训练技术的最新进展,本研究在两个域(语音信号与声门激励)中探讨用于 TTS 的波形生成。听测结果表明,尽管直接用 GAN 进行波形生成仍远落后于 WaveNet,但基于 GAN 的声门激励模型能够达到与 WaveNet 声码器相当的音质与说话人相似度。

关键词

引用

@article{arxiv.1810.12598,
  title  = {Waveform generation for text-to-speech synthesis using pitch-synchronous multi-scale generative adversarial networks},
  author = {Lauri Juvela and Bajibabu Bollepalli and Junichi Yamagishi and Paavo Alku},
  journal= {arXiv preprint arXiv:1810.12598},
  year   = {2018}
}

备注

Submitted to ICASSP 2019