中文

NatiQ:一个面向阿拉伯语的端到端文本转语音系统

计算与语言 2022-11-18 v2 声音 音频与语音处理

摘要

NatiQ是一个面向阿拉伯语的端到端文本转语音系统。我们的语音合成器使用带注意力的编码器-解码器架构。我们使用基于tacotron的模型(tacotron-1与tacotron-2)以及更快的transformer模型来从字符生成梅尔谱图。我们将Tacotron1与WaveRNN声码器、Tacotron2与WaveGlow声码器以及ESPnet transformer与parallel wavegan声码器拼接,以从谱图合成波形。我们使用内部语音数据训练两个音色的模型:1)中性男声“Hamza”——叙述通用内容与新闻;2)富有表现力的女声“Amina”——叙述儿童故事书。我们最佳系统在Amina与Hamza上分别取得4.21与4.40的平均平均意见分(MOS)。使用词错误率与字符错误率(WER与CER)以及以实时因子衡量的响应时间对系统进行客观评估,结果倾向于端到端架构ESPnet。NatiQ演示可在线访问 https://tts.qcri.org。

关键词

引用

@article{arxiv.2206.07373,
  title  = {NatiQ: An End-to-end Text-to-Speech System for Arabic},
  author = {Ahmed Abdelali and Nadir Durrani and Cenk Demiroglu and Fahim Dalvi and Hamdy Mubarak and Kareem Darwish},
  journal= {arXiv preprint arXiv:2206.07373},
  year   = {2022}
}