一种用于英语语音合成的统一前端框架
计算与语言
2024-03-27 v3 人工智能
声音
音频与语音处理
摘要
前端是英语文本转语音(TTS)系统的关键组件,负责提取对文本转语音模型合成语音至关重要的语言特征,如韵律与音素。英语 TTS 前端通常由文本归一化(TN)模块、韵律词韵律短语(PWPP)模块和字素到音素(G2P)模块组成。然而,当前英语 TTS 前端的研究仅关注单个模块,忽视了它们之间的相互依赖,导致各模块性能次优。因此,本文提出一种捕获英语 TTS 前端模块间依赖关系的统一前端框架。大量实验表明,所提方法在所有模块中均达到了最先进(SOTA)性能。
引用
@article{arxiv.2305.10666,
title = {A unified front-end framework for English text-to-speech synthesis},
author = {Zelin Ying and Chen Li and Yu Dong and Qiuqiang Kong and Qiao Tian and Yuanyuan Huo and Yuxuan Wang},
journal= {arXiv preprint arXiv:2305.10666},
year = {2024}
}
备注
Accepted in ICASSP 2024