UFANS:用于统计参数语音合成的 U 形全并行声学神经结构,速度提升 20 倍
声音
2018-11-30 v1 音频与语音处理
摘要
具有自回归结构的神经网络,如循环神经网络(RNNs),已成为近期参数化文本到语音合成(TTS)声学建模中最具吸引力的结构。尽管在捕捉长期依赖方面能力突出,这些模型包含大量无法完全并行的顺序计算。本文提出一种 U 形全并行声学神经结构(UFANS),它是用于统计参数语音合成(SPSS)的 RNN 的反卷积替代方案。实验验证,我们提出的模型在 GPU 上训练和推理均比基于 RNN 的声学模型快 20 倍以上,且语音质量相当。此外,我们还研究了信息长期依赖对合成语音质量的实际影响程度。
引用
@article{arxiv.1811.12208,
title = {UFANS: U-shaped Fully-Parallel Acoustic Neural Structure For Statistical Parametric Speech Synthesis With 20X Faster},
author = {Dabiao Ma and Zhiba Su and Yuhao Lu and Wenxuan Wang and Zhen Li},
journal= {arXiv preprint arXiv:1811.12208},
year = {2018}
}