中文

E2 TTS:极其简单的全非自回归零样本语音合成

音频与语音处理 2024-09-13 v2 声音

摘要

本文介绍了极其简单的文本转语音 (E2 TTS) 方法,这是一种全非自回归零样本文本转语音系统,具有人类水平的自然度,以及领先的说话人相似性和清晰度。在 E2 TTS 框架中,文本输入被转换为带有填充标记的字符序列。然后基于音频填充任务训练基于流匹配的 mel 频谱生成器。与许多前期工作不同,它不需要额外组件(如持续时间模型、音素转换)或复杂技术(如单调对齐搜索)。尽管如此简单,E2 TTS 仍实现了与或超越 Voicebox 和 NaturalSpeech 3 等前作相当或更好的零样本 TTS 能力。E2 TTS 的简单性也使得输入表示具有灵活性。我们提出了几种 E2 TTS 的变体,以提高推理期间的可用性。详见 https://aka.ms/e2tts/ 查看演示样本。

关键词

引用

@article{arxiv.2406.18009,
  title  = {E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS},
  author = {Sefik Emre Eskimez and Xiaofei Wang and Manthan Thakker and Canrun Li and Chung-Hsien Tsai and Zhen Xiao and Hemin Yang and Zirun Zhu and Min Tang and Xu Tan and Yanqing Liu and Sheng Zhao and Naoyuki Kanda},
  journal= {arXiv preprint arXiv:2406.18009},
  year   = {2024}
}

备注

Accepted to SLT 2024. Added evaluation data, see https://github.com/microsoft/e2tts-test-suite for more details