中文

ManaTTS Persian:为低资源语言创建 TTS 数据集的配方

声音 2024-09-12 v1 音频与语音处理

摘要

本研究介绍了 ManaTTS——目前最大规模的公开单说话人波斯语语料库,以及一个用于收集波斯语语音数据集的综合框架。ManaTTS 在开源 CC-0 许可证下发布,包含约 86 小时的音频,采样率为 44.1 kHz。除 ManaTTS 本身外,我们还生成了 VirgoolInformal 数据集,以评估用于强制对齐的波斯语语音识别模型,覆盖超过 5 小时的音频。该数据集由一个完全透明、MIT 许可证授权的管道支持,这是该领域创新的见证。该管道包括独特的句子分词工具、受限音频分段工具,以及一种新颖的强制对齐方法。这种对齐技术专为低资源语言设计,解决了该领域的关键需求。通过本数据集,我们训练了一个基于 Tacotron2 的 TTS 模型,达到了 3.76 的平均意见分数(MOS),这在自然语谱图和相同声码器生成的语音的 MOS 分别为 3.86 和 4.01 时,表明了该语料库的卓越质量和效果。

关键词

引用

@article{arxiv.2409.07259,
  title  = {ManaTTS Persian: a recipe for creating TTS datasets for lower resource languages},
  author = {Mahta Fetrat Qharabagh and Zahra Dehghanian and Hamid R. Rabiee},
  journal= {arXiv preprint arXiv:2409.07259},
  year   = {2024}
}

备注

33 pages, 12 figures