中文

基于 Inter-Pausal Unit (IPU) 的印度语言端到端语音合成系统探索

音频与语音处理 2024-09-19 v1

摘要

印度语言的句子通常比英语句子更长。印度语言也被认为是基于短语的,在此语义完整的短语被拼接成句子。长语音导致文本语音模型训练不佳,合成时语调质感差。本文我们在端到端 (E2E) 框架中探索基于 Inter-Pausal Unit (IPU) 的方法,聚焦于合成对话风格文本。我们在研究中考虑两种架构:自回归 Tacotron2 和非自回归 FastSpeech2,并针对三种印度语言(印地语、泰米尔语和泰卢固语)进行实验。采用 IPU-based Tacotron2 方法,我们在合成音频中插入和删除错误都有所减少,为 FastSpeech(2) 网络在错误减少方面提供了一个备选方案。IPU-based 方法需要更少的计算资源,语调丰富的合成效果优于常规句子-based 系统。

关键词

引用

@article{arxiv.2409.11915,
  title  = {Exploring an Inter-Pausal Unit (IPU) based Approach for Indic End-to-End TTS Systems},
  author = {Anusha Prakash and Hema A Murthy},
  journal= {arXiv preprint arXiv:2409.11915},
  year   = {2024}
}