中文

InstructTTS: 以自然语言风格提示在离散潜空间建模富有表现力的TTS

声音 2023-06-27 v2 音频与语音处理

摘要

富有表现力的文本到语音(TTS)旨在根据人类需求合成不同说话风格的语音。如今,有两种常见的控制说话风格的方法:(1)预定义一组说话风格并使用类别索引表示不同说话风格。然而,在表现力多样性方面存在局限,因为这些模型只能生成预定义的风格。(2)使用参考语音作为风格输入,这导致提取的风格信息不直观或不可解释的问题。在本研究中,我们尝试使用自然语言作为风格提示来控制合成语音中的风格,例如"充满悲伤情绪并带有些许无助感的一声叹息语调"。考虑到现有TTS语料库均不适合作为这一新任务的基准,我们首先构建了一个语音语料库,其语音样本不仅标注了内容转写文本,还标注了自然语言风格描述。然后我们提出了一种名为InstructTTS的富有表现力TTS模型,其新颖性在于以下方面:(1)我们充分利用自监督学习和跨模态度量学习的优势,提出一种新颖的三阶段训练流程以获得鲁棒的句嵌入模型,该模型能有效从风格提示中捕获语义信息并控制生成语音的说话风格。(2)我们提出在离散潜空间建模声学特征,并训练一种新颖的离散扩散概率模型来生成向量量化(VQ)声学令牌,而非常用的梅尔频谱图。(3)我们在声学模型训练中联合应用互信息(MI)估计与最小化,以最小化风格-说话人和风格-内容MI,避免风格提示中可能的内容与说话人信息泄露。

关键词

引用

@article{arxiv.2301.13662,
  title  = {InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt},
  author = {Dongchao Yang and Songxiang Liu and Rongjie Huang and Chao Weng and Helen Meng},
  journal= {arXiv preprint arXiv:2301.13662},
  year   = {2023}
}

备注

Submit to TASLP