中文

你应该在TTS中使用概率时长模型吗?很可能!尤其是对于自发语音

音频与语音处理 2024-06-11 v1 人机交互 声音

摘要

在文本转语音(TTS)中将输入符号转换为输出音频需要对语音声音的时长进行建模。领先的非自回归(NAR) TTS模型将时长建模视为一个回归问题。这样,同一句话每次都会以相同的节奏说出,这与人类说话不同。概率时长模型已被提出,但其益处的证据不一。然而,先前的研究通常只考虑朗读语音,而忽略了自发语音,尽管后者是一种更常见且变化更大的说话方式。我们比较了传统的确定性时长建模与基于条件流匹配(OT-CFM)的强大概率模型采样的时长在三种不同的NAR TTS方法(基于回归、深度生成和端到端)中的效果。在四个不同的语料库上,随机时长建模改进了概率NAR TTS方法,尤其是对于自发语音。请参阅https://shivammehta25.github.io/prob_dur/获取音频和资源。

关键词

引用

@article{arxiv.2406.05401,
  title  = {Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech},
  author = {Shivam Mehta and Harm Lameris and Rajiv Punmiya and Jonas Beskow and Éva Székely and Gustav Eje Henter},
  journal= {arXiv preprint arXiv:2406.05401},
  year   = {2024}
}

备注

5 pages, 2 figures. Final version, accepted to Interspeech 2024