中文

基于谱包络高斯-马尔可夫模型与 F0 小波分解的参数化语音合成

声音 2022-08-16 v1 音频与语音处理

摘要

基于神经网络的文本转语音已显著提升合成语音的质量。主流方法(如 Tacotron2、FastSpeech、FastPitch)通常从文本生成梅尔谱图,然后使用声码器(如 WaveNet、WaveGlow、HiFiGAN)合成语音。与传统参数化方法(如 STRAIGHT 和 WORLD)相比,基于神经声码器的端到端模型存在推理速度慢的问题,且合成语音通常不够鲁棒、缺乏可控性。在本工作中,我们提出一种新颖的改进声码器,它是一种易于训练且方便生成波形的简单信号模型。我们使用高斯-马尔可夫模型实现谱包络的鲁棒学习,并采用基于小波的统计信号处理来表征和分解 F0 特征。它能够保留精细的谱包络,并实现自然语音的高可控性。实验结果表明,我们提出的声码器在重构语音的自然度上优于传统 STRAIGHT 声码器,略优于 WaveNet,但略逊于 WaveRNN。

关键词

引用

@article{arxiv.2208.07122,
  title  = {Towards Parametric Speech Synthesis Using Gaussian-Markov Model of Spectral Envelope and Wavelet-Based Decomposition of F0},
  author = {Mohammed Salah Al-Radhi and Tamás Gábor Csapó and Csaba Zainkó and Géza Németh},
  journal= {arXiv preprint arXiv:2208.07122},
  year   = {2022}
}

备注

accepted at EUSIPCO2022