通过音频分析对潜空间进行可视化与解释以控制表现性语音合成
计算与语言
2019-03-28 v1 人工智能
机器学习
声音
音频与语音处理
摘要
近年来,文本到语音(Text-to-Speech)领域受益于深度学习技术取得了巨大进步。生成逼真的语音如今已成为可能。因此,关于表现力控制的研究——即允许以不同风格或方式生成语音——近来受到越来越多的关注。能够控制风格的系统已被开发并展现出令人印象深刻的成果。然而,控制参数通常由潜变量构成,且仍难以解释。在本文中,我们分析并比较不同的潜空间,并获得它们对表现性语音影响的解读。这将使构建具有可理解行为的可控语音合成系统成为可能。
引用
@article{arxiv.1903.11570,
title = {Visualization and Interpretation of Latent Spaces for Controlling Expressive Speech Synthesis through Audio Analysis},
author = {Noé Tits and Fengna Wang and Kevin El Haddad and Vincent Pagel and Thierry Dutoit},
journal= {arXiv preprint arXiv:1903.11570},
year = {2019}
}