中文

利用合成标注的高保真文本转语音自然语言引导

声音 2024-02-08 v1 计算与语言 音频与语音处理

摘要

在大规模数据集上训练的文本转语音模型已展现出令人印象深刻的上下文学习能力和自然度。然而,这些模型中对说话人身份和风格的控制通常需要以参考语音录音为条件,限制了创造性应用。或者,通过自然语言提示控制说话人身份和风格已展现出可喜的成果,并提供了一种直观的控制方法。然而,对人工标注描述的依赖阻碍了其向大规模数据集的扩展。我们的工作弥合了这两种方法之间的差距。我们提出了一种可扩展的方法,用于标注说话人身份、风格和录音条件的各个方面。然后,我们将该方法应用于一个 45k 小时的数据集,并用其训练一个语音语言模型。此外,我们提出了提高音频保真度的简单方法,尽管完全依赖于发现的数据,但仍显著优于近期的工作。我们的结果展示了高保真语音生成,涵盖多种口音、韵律风格、信道条件和声学条件,所有这些都由单一模型和直观的自然语言条件控制实现。音频样本可在 https://text-description-to-speech.com/ 获取。

关键词

引用

@article{arxiv.2402.01912,
  title  = {Natural language guidance of high-fidelity text-to-speech with synthetic annotations},
  author = {Dan Lyth and Simon King},
  journal= {arXiv preprint arXiv:2402.01912},
  year   = {2024}
}