中文

更多数据,更少元音:阿拉伯语 TTS 的规模化

计算与语言 2026-03-03 v1

摘要

阿拉伯语文本转语音 (TTS) 研究受限于公共训练数据的可用性以及准确的阿拉伯语 diacritization(鞘拢)模型。本文通过探索在大规模自动标注数据上进行阿拉伯语 TTS 训练来克服这一限制。具体我们构建了一个稳健的管道,用于收集阿拉伯语录音并通过语音活动检测、语音识别、自动 diacritization 以及噪声过滤进行自动处理,最终得到约 4000 小时的阿拉伯语 TTS 训练数据。我们随后使用不同数据量的 TTS 模型进行训练,分别为 100 小时、1000 小时和 4000 小时,带与不带 diacritization。我们表明,尽管在 diacritization 数据上训练的模型总体更好,但更大规模的训练数据能显著弥补鞘拢缺失的不足。我们计划发布一个无需 diacritization 的公开阿拉伯语 TTS 模型。

关键词

引用

@article{arxiv.2603.01622,
  title  = {More Data, Fewer Diacritics: Scaling Arabic TTS},
  author = {Ahmed Musleh and Yifan Zhang and Kareem Darwish},
  journal= {arXiv preprint arXiv:2603.01622},
  year   = {2026}
}