WenetSpeech4TTS:用于大型语音生成模型基准的 12800 小时中文 TTS 语料库
音频与语音处理
2024-06-21 v3
摘要
随着大型语音合成(TTS)模型的发展及训练数据的规模化,领先的 TTS 系统已取得显著性能。本文提出 WenetSpeech4TTS,一个源自开源 WenetSpeech 数据集的多领域中文语料库。为适应语音合成任务,我们调整了语料库的段落边界,提升了音频质量,消除了每个段落内的说话人混合。经过更精准的转录过程和基于质量的数据筛选,得到的 WenetSpeech4TTS 语料库包含 12800 小时的配对音频-文本数据。此外,我们创建了按段落质量分数划分的不同规模子集,以便于 TTS 模型的训练和微调。我们在 WenetSpeech4TTS 上训练和微调 VALL-E 和 NaturalSpeech 2 系统,以验证其可用性,确立了公平比较 TTS 系统基准的基准线。该语料库及相应基准已发布至 huggingface。
引用
@article{arxiv.2406.05763,
title = {WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark},
author = {Linhan Ma and Dake Guo and Kun Song and Yuepeng Jiang and Shuai Wang and Liumeng Xue and Weiming Xu and Huan Zhao and Binbin Zhang and Lei Xie},
journal= {arXiv preprint arXiv:2406.05763},
year = {2024}
}
备注
Accepted by INTERSPEECH2024