中文

利用生成对抗网络降低语音合成中的过平滑现象

声音 2018-12-18 v3 音频与语音处理

摘要

语音合成在许多实际应用中被广泛使用。近年来,语音合成技术发展迅速。然而,合成语音不自然的原因之一是它常常具有过平滑性。为了提高合成语音的自然度,我们首先提取语音的梅尔频谱图并将其转换为真实图像,然后将过平滑的梅尔频谱图图像作为输入,利用图像到图像的翻译生成对抗网络(GANs)框架生成更真实的梅尔频谱图。最后,结果表明该方法大大降低了合成语音的过平滑性,并且更接近于真实语音的梅尔频谱图。

关键词

引用

@article{arxiv.1810.10989,
  title  = {Reducing over-smoothness in speech synthesis using Generative Adversarial Networks},
  author = {Leyuan Sheng and Evgeniy N. Pavlovskiy},
  journal= {arXiv preprint arXiv:1810.10989},
  year   = {2018}
}

备注

Accepted by Siberian Symposium on Data Science and Engineering (SSDSE) 2018