中文

通过提示听众印象为预训练多说话人文本转语音系统生成说话人

声音 2024-06-14 v1 音频与语音处理

摘要

本文提出了一种语音合成系统,该系统允许用户通过描述合成语音说话人特征的提示来指定和控制说话人的声学特性。与以往的方法不同,我们的方法利用听众印象来构建提示,这些提示更容易收集,并且与说话人特征的日常描述更自然地一致。我们采用低秩自适应(LoRA)技术来快速地将预训练语言模型调整到我们的需求,便于从提示文本中提取与说话人相关的特征。此外,与其他基于提示的文本转语音(TTS)系统不同,我们将提示到说话人模块与多说话人TTS系统分离,增强了系统的灵活性以及与各种预训练多说话人TTS系统的兼容性。而且,对于提示到说话人特征模块,我们还比较了判别方法和基于流匹配的生成方法,发现结合这两种方法可以帮助系统更好地从提示中同时捕获说话人相关信息,并生成保真度更高的语音。

关键词

引用

@article{arxiv.2406.08812,
  title  = {Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems},
  author = {Zhengyang Chen and Xuechen Liu and Erica Cooper and Junichi Yamagishi and Yanmin Qian},
  journal= {arXiv preprint arXiv:2406.08812},
  year   = {2024}
}

备注

Accepted for presentation at Interspeech 2024 (with more analysis in the final Appendix part)