中文

E3 TTS:基于扩散模型的简易端到端文本转语音

声音 2023-11-03 v1 计算与语言 机器学习 音频与语音处理

摘要

我们提出 Easy End-to-End Diffusion-based Text to Speech(E3 TTS),一种基于扩散模型的简单高效的端到端文本转语音模型。E3 TTS 直接以纯文本作为输入,并通过迭代细化过程生成音频波形。与许多先前工作不同,E3 TTS 不依赖任何中间表示(如频谱图特征或对齐信息)。相反,E3 TTS 通过扩散过程对波形的时间结构进行建模。在无需额外条件信息的情况下,E3 TTS 可支持给定音频内灵活的潜在结构。这使得 E3 TTS 能够轻松适配于零样本任务(如编辑),而无需任何额外训练。实验表明,E3 TTS 可生成高保真音频,逼近最先进神经 TTS 系统的性能。音频样本见 https://e3tts.github.io。

关键词

引用

@article{arxiv.2311.00945,
  title  = {E3 TTS: Easy End-to-End Diffusion-based Text to Speech},
  author = {Yuan Gao and Nobuyuki Morioka and Yu Zhang and Nanxin Chen},
  journal= {arXiv preprint arXiv:2311.00945},
  year   = {2023}
}

备注

Accepted by ASRU 2023