基于源-滤波的生成对抗神经声码器用于高保真语音合成
音频与语音处理
2023-05-24 v1 声音
摘要
本文提出一种基于源-滤波的生成对抗神经声码器,命名为 SF-GAN,其通过将基于 F0 的源激励信号引入神经滤波框架,从输入声学特征实现高保真波形生成。SF-GAN 声码器由源模块和分辨率级条件滤波模块组成,并基于生成对抗策略进行训练。源模块从 F0 信息产生激励信号,随后分辨率级卷积滤波模块将激励信号与不同时间分辨率下处理的声学特征相结合,最终重建原始波形。实验结果表明,我们提出的 SF-GAN 声码器在分析-合成(AS)和文本到语音(TTS)任务上均优于最先进的 HiFi-GAN 和 Fre-GAN,且 SF-GAN 合成语音质量可与真实音频(ground-truth)相媲美。
引用
@article{arxiv.2304.13270,
title = {Source-Filter-Based Generative Adversarial Neural Vocoder for High Fidelity Speech Synthesis},
author = {Ye-Xin Lu and Yang Ai and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2304.13270},
year = {2023}
}
备注
Accepted by NCMMSC 2022