中文

LLM到语音:用于训练方言文本转语音模型的合成数据流水线

计算与语言 2026-03-30 v1

摘要

尽管神经文本转语音(TTS)取得了进展,但许多阿拉伯语方言品种仍未得到充分研究,大多数资源集中在现代标准阿拉伯语(MSA)和海湾方言上,导致埃及阿拉伯语——这一被最广泛理解的阿拉伯语方言——资源严重匮乏。我们通过引入NileTTS来解决这一差距:该数据集包含来自两位说话者在医疗、销售和一般对话等多个领域的38小时转录语音。我们使用一种新颖的合成流水线构建此数据集:大语言模型(LLM)生成埃及阿拉伯语内容,然后使用音频合成工具将其转换为自然语音,随后进行自动转录和说话人分离,并辅以人工质量验证。我们在我们的数据集上微调了XTTS v2(一种最先进的多语言TTS模型),并与在其他阿拉伯语方言上训练的基线模型进行了评估。我们的贡献包括:(1)首个公开可用的埃及阿拉伯语TTS数据集,(2)一个可复现的用于方言TTS的合成数据生成流水线,以及(3)一个开源微调模型。所有资源均已发布,以推动埃及阿拉伯语语音合成研究。

关键词

引用

@article{arxiv.2602.15675,
  title  = {LLM-to-Speech: A Synthetic Data Pipeline for Training Dialectal Text-to-Speech Models},
  author = {Ahmed Khaled Khamis and Hesham Ali},
  journal= {arXiv preprint arXiv:2602.15675},
  year   = {2026}
}

备注

8 pages, 2 figures, EACL26