面向提示条件语音合成的语音语言模型实证研究
计算与语言
2024-03-20 v1 声音
音频与语音处理
摘要
语音语言模型(LMs)通过上下文学习实现高质量语音合成,前景广阔。典型的语音 LM 以离散语义单元作为内容,以短语音片段作为提示,合成保留内容语义但模仿提示风格的语音。然而,对于合成音频如何受提示和内容控制,目前缺乏系统性的理解。在这项工作中,我们对广泛使用的自回归(AR)和非自回归(NAR)语音 LM 进行了实证研究,并提供了关于提示设计和内容语义单元的见解。我们的分析揭示,异质和非平稳的提示会损害音频质量,这与之前“更长提示总能带来更好合成效果”的发现相反。此外,我们发现合成音频的说话人风格除提示外也受内容影响。我们进一步表明,语义单元携带丰富的声学信息,如音高、节奏、音量和语音重音,这些信息可能从内容泄露到合成音频中。
引用
@article{arxiv.2403.12402,
title = {An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis},
author = {Yifan Peng and Ilia Kulikov and Yilin Yang and Sravya Popuri and Hui Lu and Changhan Wang and Hongyu Gong},
journal= {arXiv preprint arXiv:2403.12402},
year = {2024}
}