E3 TTS:基于扩散模型的简易端到端文本转语音
声音
2023-11-03 v1 计算与语言
机器学习
音频与语音处理
摘要
我们提出 Easy End-to-End Diffusion-based Text to Speech(E3 TTS),一种基于扩散模型的简单高效的端到端文本转语音模型。E3 TTS 直接以纯文本作为输入,并通过迭代细化过程生成音频波形。与许多先前工作不同,E3 TTS 不依赖任何中间表示(如频谱图特征或对齐信息)。相反,E3 TTS 通过扩散过程对波形的时间结构进行建模。在无需额外条件信息的情况下,E3 TTS 可支持给定音频内灵活的潜在结构。这使得 E3 TTS 能够轻松适配于零样本任务(如编辑),而无需任何额外训练。实验表明,E3 TTS 可生成高保真音频,逼近最先进神经 TTS 系统的性能。音频样本见 https://e3tts.github.io。
引用
@article{arxiv.2311.00945,
title = {E3 TTS: Easy End-to-End Diffusion-based Text to Speech},
author = {Yuan Gao and Nobuyuki Morioka and Yu Zhang and Nanxin Chen},
journal= {arXiv preprint arXiv:2311.00945},
year = {2023}
}
备注
Accepted by ASRU 2023