越南语统计参数语音合成系统的比较
音频与语音处理
2020-05-28 v1 计算与语言
声音
摘要
近年来,统计参数语音合成(SPSS)系统已被广泛应用于许多基于语音的交互系统中(例如亚马逊的 Alexa、Bose 的耳机)。为选择合适的 SPSS 系统,必须同时考虑语音质量与性能效率(例如解码时间)。在本文中,我们使用以下四种流行的越南语 SPSS 技术,从语音质量与性能效率方面进行比较:1)隐马尔可夫模型(HMM),2)深度神经网络(DNN),3)生成对抗网络(GAN),以及 4)端到端(E2E)架构,后者由 Tacontron~2 与 WaveGlow 声码器组成。我们表明,E2E 系统取得了最佳质量,但需要 GPU 算力以实现实时性能。我们也表明,基于 HMM 的系统语音质量较差,但它是效率最高的系统。令人惊讶的是,在 GPU 上推理时,E2E 系统比 DNN 和 GAN 更高效。令人惊讶的是,基于 GAN 的系统在质量方面并未优于 DNN。
引用
@article{arxiv.2005.12962,
title = {A comparison of Vietnamese Statistical Parametric Speech Synthesis Systems},
author = {Huy Kinh Phan and Viet Lam Phung and Tuan Anh Dinh and Bao Quoc Nguyen},
journal= {arXiv preprint arXiv:2005.12962},
year = {2020}
}
备注
9 pages, submitted to KSE 2020