基于超声发音到声学映射与 WaveGlow 语音合成
音频与语音处理
2020-08-10 v1 声音
摘要
对于使用深度神经网络的发音到声学映射,通常以声码器的谱参数和激励参数作为训练目标。然而,声码化常导致最终语音质量发嗡且沉闷。因此,在这篇基于超声的发音到声学转换论文中,我们使用在大量英语和匈牙利语语音数据上预训练的基于流的神经声码器(WaveGlow)。卷积神经网络的输入为超声舌图像。训练目标为80维梅尔谱图,其比先前使用的25维Mel广义倒谱给出更精细的谱表示。从超声到梅尔谱图预测的输出,经WaveGlow推断得到合成语音。我们将提出的基于WaveGlow的系统与在预测F0时不使用严格浊/清音决策的连续声码器进行比较。结果表明,在发音到声学映射实验中,WaveGlow神经声码器比基线系统合成出显著更自然的语音。此外,WaveGlow的优势在于F0包含在梅尔谱图表示中,无需单独预测激励。
引用
@article{arxiv.2008.03152,
title = {Ultrasound-based Articulatory-to-Acoustic Mapping with WaveGlow Speech Synthesis},
author = {Tamás Gábor Csapó and Csaba Zainkó and László Tóth and Gábor Gosztolya and Alexandra Markó},
journal= {arXiv preprint arXiv:2008.03152},
year = {2020}
}
备注
5 pages, accepted for publication at Interspeech 2020. arXiv admin note: substantial text overlap with arXiv:1906.09885