中文

ClArTTS:一个开源古典阿拉伯语文本转语音语料库

计算与语言 2023-03-02 v1 声音 音频与语音处理

摘要

目前,使用高质量转写语音数据、基于端到端神经模型训练的语音合成(TTS)系统可生成清晰、自然且接近人声的语音。这些模型使用相对较大的单说话人专业录音音频训练,通常提取自有声书。同时,由于此类自由可用语音语料库的稀缺,阿拉伯语 TTS 研发存在较大缺口。现有大多数自由可用的阿拉伯语语音语料库不适合 TTS 训练,因其包含多说话人随意语音且录制条件与质量不一,而为语音合成策划的语料库通常规模较小,不适合训练最先进的端到端模型。为填补此资源缺口,我们提出一个用于古典阿拉伯语文本转语音(ClArTTS)的语音语料库,以支持阿拉伯语端到端 TTS 系统的开发。该语音提取自 LibriVox 有声书,经处理、切分并人工转写与标注。最终 ClArTTS 语料库包含约 12 小时来自单男性说话人、采样率 40100 kHz 的语音。本文中,我们描述语料库创建过程,并提供语料库统计细节及与现有资源的比较。此外,我们基于 Grad-TTS 与 Glow-TTS 开发了两个 TTS 系统,并通过主观与客观评测展示所得系统性能。该语料库及基线 TTS 系统演示将出于研究目的在 www.clartts.com 公开提供。

关键词

引用

@article{arxiv.2303.00069,
  title  = {ClArTTS: An Open-Source Classical Arabic Text-to-Speech Corpus},
  author = {Ajinkya Kulkarni and Atharva Kulkarni and Sara Abedalmonem Mohammad Shatnawi and Hanan Aldarmaki},
  journal= {arXiv preprint arXiv:2303.00069},
  year   = {2023}
}

备注

None