中文

面向13种印度语言、借助信号处理辅助对齐开发最先进的TTS合成器

音频与语音处理 2024-09-19 v2 声音

摘要

端到端(E2E)系统能够合成高质量语音,但这通常需要大量数据。随着E2E合成从Tacotron发展到FastSpeech2,代表韵律的特征(尤其是子词时长)对无错误合成的重要性变得显而易见。FastSpeech的变体使用教师模型或强制对齐进行训练。本文利用信号处理线索与强制对齐相结合,为训练数据生成准确的音素边界。得益于更好的时长建模,我们开发了高质量的合成器。评估表明,使用所提出的信号处理辅助方法开发的系统优于使用其他对齐方法开发的系统,尤其在低资源场景下。我们的系统也优于现有可用的13种印度语言的最佳TTS系统。

关键词

引用

@article{arxiv.2210.17153,
  title  = {Towards Developing State-of-the-Art TTS Synthesisers for 13 Indian Languages with Signal Processing aided Alignments},
  author = {Anusha Prakash and S Umesh and Hema A Murthy},
  journal= {arXiv preprint arXiv:2210.17153},
  year   = {2024}
}

备注

Version 1 uploaded