中文

面向提示条件语音合成的语音语言模型实证研究

计算与语言 2024-03-20 v1 声音 音频与语音处理

摘要

语音语言模型(LMs)通过上下文学习实现高质量语音合成,前景广阔。典型的语音 LM 以离散语义单元作为内容,以短语音片段作为提示,合成保留内容语义但模仿提示风格的语音。然而,对于合成音频如何受提示和内容控制,目前缺乏系统性的理解。在这项工作中,我们对广泛使用的自回归(AR)和非自回归(NAR)语音 LM 进行了实证研究,并提供了关于提示设计和内容语义单元的见解。我们的分析揭示,异质和非平稳的提示会损害音频质量,这与之前“更长提示总能带来更好合成效果”的发现相反。此外,我们发现合成音频的说话人风格除提示外也受内容影响。我们进一步表明,语义单元携带丰富的声学信息,如音高、节奏、音量和语音重音,这些信息可能从内容泄露到合成音频中。

关键词

引用

@article{arxiv.2403.12402,
  title  = {An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis},
  author = {Yifan Peng and Ilia Kulikov and Yilin Yang and Sravya Popuri and Hui Lu and Changhan Wang and Hongyu Gong},
  journal= {arXiv preprint arXiv:2403.12402},
  year   = {2024}
}