RefineGAN:以高精度音高与强度响应通用生成优于真值的波形
声音
2022-03-22 v3 人工智能
音频与语音处理
摘要
大多数基于GAN(Generative Adversarial Network,生成对抗网络)的高保真波形生成方法严重依赖判别器来提升性能。然而,GAN方法给生成过程引入大量不确定性,并常导致音高与强度不匹配,这在歌唱声音合成(SVS)等敏感应用场景中是致命的。为解决此问题,我们提出RefineGAN,一种专注于鲁棒性、音高与强度准确性以及高速全频带音频生成的高保真神经声码器。我们采用了带音高引导的精炼架构与基于多尺度频谱图的损失函数,以在使用基于GAN的训练方法时稳定训练过程并保持神经声码器的鲁棒性。与真值音频相比,用该方法生成的音频在主观测试中表现更优。该结果表明,通过消除录制过程产生的缺陷,波形重建中的保真度甚至得以提升。此外,这表明在指定类型数据上训练的模型,在完全未见过的语言和未见过的说话人上也能表现同样良好。生成样本对见https://timedomain-tech.github.io/refinegan/。
引用
@article{arxiv.2111.00962,
title = {RefineGAN: Universally Generating Waveform Better than Ground Truth with Highly Accurate Pitch and Intensity Responses},
author = {Shengyuan Xu and Wenxiao Zhao and Jing Guo},
journal= {arXiv preprint arXiv:2111.00962},
year = {2022}
}
备注
Submitted to INTERSPEECH2022