中文

面向 22 种印度语言的文本转语音合成数据集收集统一框架

音频与语音处理 2024-10-21 v1

摘要

文本转语音(TTS)合成模型的性能取决于多种因素,其中训练数据的质量尤为重要。全球范围内已收集了数百万数据用于各种语言,但印度语言的资源却寥寥。尽管已有众多数据收集努力,但为数据收集制定统一的协议变得必要,以构建印度语言的 TTS 系统,主要是因为需要跨语言统一开发 TTS 系统。本文总结了我们在印度语言数据收集方面历经 15 年的经验。这些数据库已用于单元选择合成、基于隐马尔可夫模型的以及端到端框架,并用于生成富有韵律的 TTS 系统。最显著的特征是收集的数据纯度,使得即使在数据量较小的情况下(相对于欧洲/中文语言),也能构建高质量的 TTS 系统。

关键词

引用

@article{arxiv.2410.14197,
  title  = {A Unified Framework for Collecting Text-to-Speech Synthesis Datasets for 22 Indian Languages},
  author = {Sujitha Sathiyamoorthy and N Mohana and Anusha Prakash and Hema A Murthy},
  journal= {arXiv preprint arXiv:2410.14197},
  year   = {2024}
}

备注

Submitted to ICASSP 2025