结合生成对抗网络的统计参数语音合成
声音
2017-09-26 v1 机器学习
音频与语音处理
摘要
本文提出了一种结合生成对抗网络 (GANs) 的统计参数语音合成方法。尽管强大的深度神经网络 (DNNs) 技术可用于人工合成语音波形,但与自然语音相比,合成语音的质量仍然较低。导致质量下降的问题之一是在生成的语音参数中经常观察到的过平滑效应。本文引入的 GAN 由两个神经网络组成:一个用于区分自然样本与生成样本的判别器,以及一个用于欺骗判别器的生成器。在结合 GANs 的提出框架中,判别器被训练以区分自然和生成的语音参数,而声学模型被训练以最小化常规最小生成损失与用于欺骗判别器的对抗损失之和。由于 GANs 的目标是最小化自然和生成语音参数之间的散度(即分布差异),所提出的方法有效缓解了生成语音参数上的过平滑效应。我们在文本到语音和语音转换任务中评估了该方法的有效性,发现无论超参数设置如何,所提出的方法都能比常规最小生成误差训练算法生成更自然的频谱参数和 。此外,我们研究了各种 GANs 的散度效应,发现最小化 Earth-Mover's 距离的 Wasserstein GAN 在提高合成语音质量方面效果最佳。
引用
@article{arxiv.1709.08041,
title = {Statistical Parametric Speech Synthesis Incorporating Generative Adversarial Networks},
author = {Yuki Saito and Shinnosuke Takamichi and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:1709.08041},
year = {2017}
}
备注
Preprint manuscript of IEEE/ACM Transactions on Audio, Speech and Language Processing