中文

一种用于英语语音合成的统一前端框架

计算与语言 2024-03-27 v3 人工智能 声音 音频与语音处理

摘要

前端是英语文本转语音(TTS)系统的关键组件,负责提取对文本转语音模型合成语音至关重要的语言特征,如韵律与音素。英语 TTS 前端通常由文本归一化(TN)模块、韵律词韵律短语(PWPP)模块和字素到音素(G2P)模块组成。然而,当前英语 TTS 前端的研究仅关注单个模块,忽视了它们之间的相互依赖,导致各模块性能次优。因此,本文提出一种捕获英语 TTS 前端模块间依赖关系的统一前端框架。大量实验表明,所提方法在所有模块中均达到了最先进(SOTA)性能。

关键词

引用

@article{arxiv.2305.10666,
  title  = {A unified front-end framework for English text-to-speech synthesis},
  author = {Zelin Ying and Chen Li and Yu Dong and Qiuqiang Kong and Qiao Tian and Yuanyuan Huo and Yuxuan Wang},
  journal= {arXiv preprint arXiv:2305.10666},
  year   = {2024}
}

备注

Accepted in ICASSP 2024