E1 TTS:简单快速的非自回归语音合成
音频与语音处理
2024-09-17 v1 声音
摘要
本文介绍 Easy One-Step Text-to-Speech(E1 TTS),这是一种基于去噪扩散预训练和分布匹配蒸馏的高效非自回归零样本文本到语音系统。E1 TTS 的训练过程简明易行,无需在文本和音频对之间建立明确的单调对齐。E1 TTS 的推理过程高效,只需对每个语音 utterance 进行一次神经网络评估。尽管具有采样效率优势,E1 TTS 仍能实现与各种强大基线模型相当的自然度和说话人相似度。音频样本可在 http://e1tts.github.io/ 上查阅。
引用
@article{arxiv.2409.09351,
title = {E1 TTS: Simple and Fast Non-Autoregressive TTS},
author = {Zhijun Liu and Shuai Wang and Pengcheng Zhu and Mengxiao Bi and Haizhou Li},
journal= {arXiv preprint arXiv:2409.09351},
year = {2024}
}