基于深度学习的表现型语音合成系统可控性分析与评估
声音
2021-03-09 v1 人工智能
计算与语言
人机交互
音频与语音处理
摘要
本文中,我们研究在用于连续控制的数据集上训练的表现型 TTS(语音合成)系统的可控性。该数据集为 Blizzard 2013 数据集,基于一名女性说话人朗读的有声书,包含风格与表现力的极大变化。可控性通过客观与主观实验共同评估。客观评估基于声学特征与表征表现力的潜空间维度之间相关性的度量。主观评估基于一项感知实验,其中向用户展示一个可控表现型 TTS 界面,并要求检索出表现力在主观上对应于某参考语句的合成语音。
引用
@article{arxiv.2103.04097,
title = {Analysis and Assessment of Controllability of an Expressive Deep Learning-based TTS system},
author = {Noé Tits and Kevin El Haddad and Thierry Dutoit},
journal= {arXiv preprint arXiv:2103.04097},
year = {2021}
}