使用基音同步多尺度生成对抗网络进行文本到语音合成的波形生成
音频与语音处理
2018-10-31 v1 声音
机器学习
摘要
由于 WaveNet 等新型神经波形生成方法,文本到语音合成的最先进水平近来得到显著改善。然而,这些方法受限于其缓慢的序列推理过程,而其并行版本难以训练且计算开销更大。与此同时,生成对抗网络(GANs)在图像生成中已取得令人印象深刻的成果,并正进入音频应用;并行推理正是其诱人特性之一。通过采用 GAN 训练技术的最新进展,本研究在两个域(语音信号与声门激励)中探讨用于 TTS 的波形生成。听测结果表明,尽管直接用 GAN 进行波形生成仍远落后于 WaveNet,但基于 GAN 的声门激励模型能够达到与 WaveNet 声码器相当的音质与说话人相似度。
引用
@article{arxiv.1810.12598,
title = {Waveform generation for text-to-speech synthesis using pitch-synchronous multi-scale generative adversarial networks},
author = {Lauri Juvela and Bajibabu Bollepalli and Junichi Yamagishi and Paavo Alku},
journal= {arXiv preprint arXiv:1810.12598},
year = {2018}
}
备注
Submitted to ICASSP 2019