ESPnet-TTS:统一、可复现且可集成的开源端到端文本到语音工具包
计算与语言
2020-02-18 v2 音频与语音处理
摘要
本文介绍了一个名为 ESPnet-TTS 的新型端到端文本到语音(E2E-TTS)工具包,它是开源语音处理工具包 ESPnet 的扩展。该工具包支持最先进的 E2E-TTS 模型,包括 Tacotron~2、Transformer TTS 和 FastSpeech,并提供了受 Kaldi 自动语音识别(ASR)工具包启发的配方。这些配方基于与 ESPnet ASR 配方统一的设计,具有高可复现性。该工具包还提供所有配方的预训练模型和样本,以便用户将其用作基线。此外,统一的设计实现了 ASR 功能与 TTS 的集成,例如基于 ASR 的客观评估和利用 ASR 与 TTS 模型的半监督学习。本文描述了该工具包的设计以及与其它工具包比较的实验评估。实验结果表明,我们的模型可以达到与其他最新工具包相当的最先进性能,在 LJSpeech 数据集上获得了 4.25 的平均意见得分(MOS)。该工具包公开于 https://github.com/espnet/espnet。
引用
@article{arxiv.1910.10909,
title = {ESPnet-TTS: Unified, Reproducible, and Integratable Open Source End-to-End Text-to-Speech Toolkit},
author = {Tomoki Hayashi and Ryuichi Yamamoto and Katsuki Inoue and Takenori Yoshimura and Shinji Watanabe and Tomoki Toda and Kazuya Takeda and Yu Zhang and Xu Tan},
journal= {arXiv preprint arXiv:1910.10909},
year = {2020}
}
备注
Accepted to ICASSP2020. Demo HP: https://espnet.github.io/icassp2020-tts/