NatiQ:一个面向阿拉伯语的端到端文本转语音系统
计算与语言
2022-11-18 v2 声音
音频与语音处理
摘要
NatiQ是一个面向阿拉伯语的端到端文本转语音系统。我们的语音合成器使用带注意力的编码器-解码器架构。我们使用基于tacotron的模型(tacotron-1与tacotron-2)以及更快的transformer模型来从字符生成梅尔谱图。我们将Tacotron1与WaveRNN声码器、Tacotron2与WaveGlow声码器以及ESPnet transformer与parallel wavegan声码器拼接,以从谱图合成波形。我们使用内部语音数据训练两个音色的模型:1)中性男声“Hamza”——叙述通用内容与新闻;2)富有表现力的女声“Amina”——叙述儿童故事书。我们最佳系统在Amina与Hamza上分别取得4.21与4.40的平均平均意见分(MOS)。使用词错误率与字符错误率(WER与CER)以及以实时因子衡量的响应时间对系统进行客观评估,结果倾向于端到端架构ESPnet。NatiQ演示可在线访问 https://tts.qcri.org。
引用
@article{arxiv.2206.07373,
title = {NatiQ: An End-to-end Text-to-Speech System for Arabic},
author = {Ahmed Abdelali and Nadir Durrani and Cenk Demiroglu and Fahim Dalvi and Hamdy Mubarak and Kareem Darwish},
journal= {arXiv preprint arXiv:2206.07373},
year = {2022}
}