中文

ParsVoice:面向文本转语音合成的大规模多说话人波斯语语料库

声音 2026-05-27 v3 人工智能 人机交互 机器学习

摘要

波斯语在开放语音-文本资源方面仍存在显著不足,这限制了多说话人文本转语音 (TTS)、语音语言建模以及低资源语音处理的进展。我们引入 ParsVoice——目前公开available 最大的面向多说话人 TTS 系统构建的波斯语语音-文本语料库,同时提供了一个可扩展的管道,用于从长篇有声书录音中构建高质量的语音-文本数据。该管道结合了微调的 ParsBERT 句子完成分类器、ASR 基于边界的优化、标点恢复、说话人识别以及覆盖音频和波斯语特定文本属性的多维质量评估。最终的发布版本包含 2,200 小时 TTS 就绪子集,来自 1,815 个自动识别说话人 ID 的 136 万个对齐语段,规模是目前最大的公开波斯语 TTS 数据集的 25 倍以上。为验证该语料库,我们对 XTTS 进行微调——这是一款可直接在原始波斯语文本上运行且无需音素表示的零样本多语言 TTS 模型,实现了 3.6/5 的自然度 MOS 和 4.0/5 的说话人相似度 MOS。ParsVoice 数据集可在 https://huggingface.co/datasets/MohammadJRanjbar/ParsVoice 上公开获取。

关键词

引用

@article{arxiv.2510.10774,
  title  = {ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis},
  author = {Mohammad Javad Ranjbar Kalahroodi and Heshaam Faili and Azadeh Shakery},
  journal= {arXiv preprint arXiv:2510.10774},
  year   = {2026}
}