中文

StyleTTS-ZS:基于提炼时变风格扩散的高效零样文本到语音合成

音频与语音处理 2024-09-17 v1 声音

摘要

大规模文本到语音(TTS)模型的快速发展导致了在建模多样化说话人语调和声线方面取得显著进展。然而,这些模型常面临推理速度慢、依赖复杂预训练神经编解码器表示、难以实现自然性和与参考说话人的高度相似性等问题。为此,本工作引入 StyleTTS-ZS,一个高效零样 TTS 模型,利用提炼时变风格扩散捕获多样化说话人身份和语调。我们提出一种新方法,将人类语音表示为输入文本和固定长度时变离散风格代码,以捕获多样化的语调变化,采用对抗式训练并配合多模态判别器。随后构建一个扩散模型,用于高效潜在扩散采样此时变风格代码。利用无分类器引导,StyleTTS-ZS 在风格扩散过程中实现与参考说话人的高度相似性。此外,为加快采样速度,对风格扩散模型进行感知损失蒸馏,仅需 1 万样本,即可保持语音质量和相似性,同时将推理速度提高 90%。我们的模型在自然度和相似性方面超越了前沿的大规模零样 TTS 模型,提供 10-20 倍的采样速度,为高效大规模零样 TTS 系统提供了吸引力的替代方案。音频演示、代码和模型均可在 https://styletts-zs.github.io/ 获取。

关键词

引用

@article{arxiv.2409.10058,
  title  = {StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion},
  author = {Yinghao Aaron Li and Xilin Jiang and Cong Han and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2409.10058},
  year   = {2024}
}