使用 AR 与基于流的先验网络预测音素级韵律隐变量用于表现力语音合成
声音
2022-11-03 v1 计算与语言
机器学习
音频与语音处理
摘要
表现力语音合成文献的很大一部分聚焦于学习语音信号的韵律表征,随后在推理时由先验分布对其建模。本文中,我们比较不同先验架构在预测以无监督 FVAE 模型提取的音素级韵律表征任务上的表现。我们使用主客观指标表明,基于归一化流(normalizing flow)的先验网络可生成更具表现力的语音,代价是质量略有下降。此外,由于归一化流的特性,对于给定的文本,合成语音具有更高的多样性。我们还提出一种动态 VAE(Dynamical VAE)模型,其可生成更高质量的语音,但与基于流的模型相比表现力与多样性均降低。
引用
@article{arxiv.2211.01327,
title = {Predicting phoneme-level prosody latents using AR and flow-based Prior Networks for expressive speech synthesis},
author = {Konstantinos Klapsas and Karolos Nikitaras and Nikolaos Ellinas and June Sig Sung and Inchul Hwang and Spyros Raptis and Aimilios Chalamandaris and Pirros Tsiakoulis},
journal= {arXiv preprint arXiv:2211.01327},
year = {2022}
}
备注
Submitted to ICASSP 2023