中文

ESPnet2-TTS:拓展语音合成研究的前沿

计算与语言 2021-10-18 v1 声音 音频与语音处理

摘要

本文介绍ESPnet2-TTS,一个端到端文本到语音(E2E-TTS)工具包。ESPnet2-TTS通过添加许多新功能扩展了我们早期的版本ESPnet-TTS,这些功能包括:动态灵活预处理、与神经声码器的联合训练,以及带有扩展功能(如全频带E2E文本到波形建模)的当前最优TTS模型,这些扩展简化了训练流程并进一步提升了TTS性能。我们配方(recipes)的统一设计使用户能够快速复现当前最优的E2E-TTS结果。我们还提供了一个统一的Python接口用于推理的许多预训练模型,为用户生成基线样本和构建演示提供了快速途径。基于英语和日语语料库的实验评估表明,我们提供的模型合成的语音与真实语音相当,达到了当前最优的TTS性能。该工具包可在https://github.com/espnet/espnet在线获取。

关键词

引用

@article{arxiv.2110.07840,
  title  = {ESPnet2-TTS: Extending the Edge of TTS Research},
  author = {Tomoki Hayashi and Ryuichi Yamamoto and Takenori Yoshimura and Peter Wu and Jiatong Shi and Takaaki Saeki and Yooncheol Ju and Yusuke Yasuda and Shinnosuke Takamichi and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2110.07840},
  year   = {2021}
}

备注

Submitted to ICASSP2022. Demo HP: https://espnet.github.io/icassp2022-tts/