面向多说话人神经文本到语音的多任务对抗训练算法
声音
2022-09-27 v1 人工智能
机器学习
音频与语音处理
摘要
我们提出了一种基于多任务对抗训练的、用于多说话人神经文本到语音(TTS)模型的新型训练算法。传统的基于生成对抗网络(GAN)的训练算法通过减小自然语音与合成语音之间的统计差异,显著提升了合成语音的质量。然而,该算法无法保证训练得到的TTS模型在合成训练数据中未包含的无见过的说话人语音时的泛化性能。我们的算法交替训练两个深度神经网络:多任务判别器与多说话人神经TTS模型(即GAN的生成器)。判别器不仅被训练以区分自然与合成语音,还被训练以验证输入语音的说话人是已存在的还是不存在的(即由已见说话人嵌入向量插值新生成)。同时,生成器被训练以最小化语音重建损失与对抗损失(用于欺骗判别器)的加权和,从而即使目标说话人未见过也能实现高质量的多说话人TTS。实验评估表明,我们的算法在合成语音质量上优于传统的GANSpeech算法。
引用
@article{arxiv.2209.12549,
title = {Multi-Task Adversarial Training Algorithm for Multi-Speaker Neural Text-to-Speech},
author = {Yusuke Nakai and Yuki Saito and Kenta Udagawa and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2209.12549},
year = {2022}
}
备注
6 pages, 1 figure, Accepted for APSIPA ASC 2022