中文

多任务学习框架下基于生成对抗网络的统计参数语音合成

声音 2017-07-12 v2

摘要

本文旨在基于生成对抗网络(GAN)改进统计参数语音合成(SPSS)中合成语音的性能。特别地,我们提出了一种在多任务学习(MTL)框架下结合传统声学损失函数和 GAN 判别损失的新架构。均方误差(MSE)通常用于估计深度神经网络的参数,其仅考虑原始音频与合成音频之间的数值差异。为缓解此问题,我们引入 GAN 作为第二个任务以确定输入是否为具有特定条件的自然语音。在此 MTL 框架中,MSE 优化改善了 GAN 的稳定性,同时 GAN 生成更接近自然语音分布的样本。听感测试表明,多任务架构能比传统方法生成更符合人类感知的自然语音。

关键词

引用

@article{arxiv.1707.01670,
  title  = {Statistical Parametric Speech Synthesis Using Generative Adversarial Networks Under A Multi-task Learning Framework},
  author = {Shan Yang and Lei Xie and Xiao Chen and Xiaoyan Lou and Xuan Zhu and Dongyan Huang and Haizhou Li},
  journal= {arXiv preprint arXiv:1707.01670},
  year   = {2017}
}

备注

Submitted to Automatic Speech Recognition and Understanding (ASRU) 2017 Workshop