利用生成对抗网络降低语音合成中的过平滑现象
声音
2018-12-18 v3 音频与语音处理
摘要
语音合成在许多实际应用中被广泛使用。近年来,语音合成技术发展迅速。然而,合成语音不自然的原因之一是它常常具有过平滑性。为了提高合成语音的自然度,我们首先提取语音的梅尔频谱图并将其转换为真实图像,然后将过平滑的梅尔频谱图图像作为输入,利用图像到图像的翻译生成对抗网络(GANs)框架生成更真实的梅尔频谱图。最后,结果表明该方法大大降低了合成语音的过平滑性,并且更接近于真实语音的梅尔频谱图。
引用
@article{arxiv.1810.10989,
title = {Reducing over-smoothness in speech synthesis using Generative Adversarial Networks},
author = {Leyuan Sheng and Evgeniy N. Pavlovskiy},
journal= {arXiv preprint arXiv:1810.10989},
year = {2018}
}
备注
Accepted by Siberian Symposium on Data Science and Engineering (SSDSE) 2018