VoiceX:用于自定义语音的文本转语音框架
人机交互
2024-08-23 v1 声音
音频与语音处理
摘要
现代 TTS 系统能够创建高度逼真和自然的语音。尽管如此,定制 TTS 语音的过程仍然复杂,主要需要该领域专家的专业知识。一个原因是利用深度学习模型,其特征是其扩张的、不可解释的参数空间,限制了手动定制的可行性。本文提出了一种基于演化算法的人类在环范式,直接与神经网络 TTS 模型的参数空间交互。我们将我们的方案集成到一个用户友好的图形用户界面中,允许用户高效创建原创语音。这些语音可以与我们提供的 Python API 的背板 TTS 模型一起使用。进一步地,我们呈现了用户研究结果,探讨了 VoiceX 的能力。我们显示 VoiceX 是创建个体、自定义语音的合适工具。
引用
@article{arxiv.2408.12170,
title = {VoiceX: A Text-To-Speech Framework for Custom Voices},
author = {Silvan Mertes and Daksitha Withanage Don and Otto Grothe and Johanna Kuch and Ruben Schlagowski and Elisabeth André},
journal= {arXiv preprint arXiv:2408.12170},
year = {2024}
}