Multi-SpectroGAN:基于对抗风格组合实现高多样性与高保真谱图生成的语音合成方法
音频与语音处理
2020-12-15 v1
摘要
尽管基于生成对抗网络(GAN)的神经文本到语音(TTS)系统在神经语音合成方面已取得显著进展,但目前尚无 TTS 系统仅借助对抗反馈从文本序列学习合成语音。由于单独的对抗反馈不足以训练生成器,现有模型仍需要将重建损失在真实值与生成的梅尔谱图之间直接进行比较。本文提出 Multi-SpectroGAN(MSG),它通过将生成器的自监督隐表示作为条件输入给条件判别器,从而仅利用对抗反馈训练多说话人模型。这为生成器训练提供了更好的引导。此外,我们还提出对抗风格组合(ASC)以在未见过的说话风格和文本上获得更好的泛化能力,其可从多个梅尔谱图中学习组合风格嵌入的隐表示。在 ASC 和特征匹配的联合训练下,MSG 通过控制和混合个体说话风格(如时长、音高和能量)来合成高多样性的梅尔谱图。结果表明,MSG 合成的高保真梅尔谱图其自然度 MOS 分数与真实梅尔谱图几乎相同。
引用
@article{arxiv.2012.07267,
title = {Multi-SpectroGAN: High-Diversity and High-Fidelity Spectrogram Generation with Adversarial Style Combination for Speech Synthesis},
author = {Sang-Hoon Lee and Hyun-Wook Yoon and Hyeong-Rae Noh and Ji-Hoon Kim and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2012.07267},
year = {2020}
}
备注
9 pages, 3 figures, Accepted paper in AAAI Conference on Artificial Intelligence (AAAI), 2021