中文

SimpleSpeech:基于标量潜在Transformer扩散模型的简单高效文本到语音

声音 2024-06-17 v3 音频与语音处理

摘要

本研究提出了一种基于扩散的简单高效非自回归(NAR)文本到语音(TTS)系统,名为SimpleSpeech。其简洁性体现在三个方面:(1)它可以在仅含语音的数据集上训练,无需任何对齐信息;(2)它直接以纯文本为输入,通过NAR方式生成语音;(3)它尝试在有限且紧凑的潜在空间中建模语音,从而减轻扩散的建模难度。更具体地,我们提出了一种新颖的带有标量量化的语音编解码模型(SQ-Codec),SQ-Codec有效地将复杂语音信号映射到有限且紧凑的潜在空间,称为标量潜在空间。得益于SQ-Codec,我们在SQ-Codec的标量潜在空间中应用了一种新颖的Transformer扩散模型。我们在4k小时的仅含语音数据集上训练SimpleSpeech,它展现出自然的韵律和语音克隆能力。与之前的大规模TTS模型相比,它在语音质量和生成速度上都有显著提升。演示已发布。

关键词

引用

@article{arxiv.2406.02328,
  title  = {SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models},
  author = {Dongchao Yang and Dingdong Wang and Haohan Guo and Xueyuan Chen and Xixin Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2406.02328},
  year   = {2024}
}

备注

Accepted by InterSpeech 2024