统一源-滤波器 GAN:基于准周期并行 WaveGAN 分解的统一源-滤波器网络
声音
2021-06-29 v3 机器学习
音频与语音处理
摘要
我们提出一种统一的数据驱动源-滤波器建模方法,使用单一神经网络开发神经声码器,能够生成高质量合成语音波形,同时保留源-滤波器模型控制其声音特征的灵活性。我们提出的称为统一源-滤波器生成对抗网络(uSFGAN)的网络,通过将基于单一神经网络的神经声码器之一——准周期并行 WaveGAN(QPPWG)分解为源激励生成网络与声道共振滤波网络,并额外实现正则化损失来构建。此外,受神经源滤波器(NSF)启发,仅额外使用正弦波形作为最简线索来生成周期源激励波形,同时将源滤波器模型中近似的影响降至最低。实验结果表明,uSFGAN 在语音质量与音高可控性上均优于传统的神经声码器,如 QPPWG 与 NSF。
引用
@article{arxiv.2104.04668,
title = {Unified Source-Filter GAN: Unified Source-filter Network Based On Factorization of Quasi-Periodic Parallel WaveGAN},
author = {Reo Yoneyama and Yi-Chiao Wu and Tomoki Toda},
journal= {arXiv preprint arXiv:2104.04668},
year = {2021}
}
备注
Submitted to INTERSPEECH 2021