基于生成对抗网络与清浊音感知条件判别器的并行波形合成
音频与语音处理
2021-04-27 v2 机器学习
声音
信号处理
摘要
本文针对基于 Parallel WaveGAN 的波形合成系统提出清浊音感知条件判别器。在该框架中,我们采用基于投影的条件化方法,可显著提升判别器性能。此外,将常规判别器分离为两个波形判别器,分别建模浊音与清音语音。由于每个判别器分别学习谐波与噪声分量的显著特征,对抗训练过程变得更高效,使生成器能产生更真实的语音波形。主观测试结果表明所提方法优于常规 Parallel WaveGAN 与 WaveNet 系统。特别地,我们在基于 FastSpeech 2 的文本到语音框架中以说话人无关方式训练的模型,对四位日语说话人分别取得 4.20、4.18、4.21 与 4.31 的平均意见得分。
引用
@article{arxiv.2010.14151,
title = {Parallel waveform synthesis based on generative adversarial networks with voicing-aware conditional discriminators},
author = {Ryuichi Yamamoto and Eunwoo Song and Min-Jae Hwang and Jae-Min Kim},
journal= {arXiv preprint arXiv:2010.14151},
year = {2021}
}
备注
Accepted to the conference of ICASSP 2021