基于Wasserstein GAN与波形损失的多说话人WaveNet声码器文本转语音声学模型训练
音频与语音处理
2018-08-01 v1 计算与语言
声音
机器学习
摘要
近期诸如WaveNet和sampleRNN等直接从语音波形样本学习的神经网络,即使在多说话人文本转语音合成系统中,也在自然度和说话人相似度方面实现了极高质量的合成语音。此类神经网络正被用作声码器的替代方案,因而常被称为神经声码器。神经声码器使用声学特征作为局部条件参数,而这些参数需由另一声学模型准确预测。然而,如何训练该声学模型尚不明晰,这成为问题,因为合成语音的最终质量受声学模型性能显著影响。尤其当预测的声学特征与自然特征特性失配时,质量会严重下降。为减少自然与生成声学特征间的特性失配,我们提出将条件生成对抗网络(GAN)或其变体带梯度惩罚的Wasserstein GAN(WGAN-GP)融入使用WaveNet声码器的多说话人语音合成的框架。我们还扩展了GAN框架,除均方误差与对抗损失外,将训练良好的WaveNet的离散混合逻辑斯蒂损失也用作目标函数的一部分。实验结果表明,采用反向传播的离散混合逻辑斯蒂(DML)损失的WGAN-GP框架训练的声学模型在质量和说话人相似度主观评价中得分最高。
引用
@article{arxiv.1807.11679,
title = {Wasserstein GAN and Waveform Loss-based Acoustic Model Training for Multi-speaker Text-to-Speech Synthesis Systems Using a WaveNet Vocoder},
author = {Yi Zhao and Shinji Takaki and Hieu-Thi Luong and Junichi Yamagishi and Daisuke Saito and Nobuaki Minematsu},
journal= {arXiv preprint arXiv:1807.11679},
year = {2018}
}