基于对抗网络的高保真语音合成
声音
2019-09-30 v2 机器学习
音频与语音处理
摘要
生成对抗网络近年来发展迅速,并显著改进了图像生成建模。然而,它们在音频领域的应用受到的关注有限,且自回归模型(如 WaveNet)仍是人类语音等音频信号生成建模的最先进方法。为解决这一不足,我们引入了 GAN-TTS,一种用于文本转语音的生成对抗网络。我们的架构由一个生成原始语音音频的条件前馈生成器和一组在不同随机窗口上运作的判别器组成。判别器从整体真实感以及音频与应发音内容的对应程度两方面分析音频。为衡量 GAN-TTS 的性能,我们采用了主观人类评估(MOS——平均意见得分)以及新颖的定量指标(Fr\'echet DeepSpeech 距离和 Kernel DeepSpeech 距离),我们发现它们与 MOS 相关性良好。我们表明 GAN-TTS 能够生成自然度可与最先进模型媲美的高保真语音,且与自回归模型不同,得益于高效的前馈生成器,它具有高度并行性。可在 https://storage.googleapis.com/deepmind-media/research/abstract.wav 收听 GAN-TTS 朗读本摘要。
引用
@article{arxiv.1909.11646,
title = {High Fidelity Speech Synthesis with Adversarial Networks},
author = {Mikołaj Bińkowski and Jeff Donahue and Sander Dieleman and Aidan Clark and Erich Elsen and Norman Casagrande and Luis C. Cobo and Karen Simonyan},
journal= {arXiv preprint arXiv:1909.11646},
year = {2019}
}