HiFiTTS-2:大规模高带宽语音数据集
音频与语音处理
2025-09-23 v2
摘要
本文介绍了 HiFiTTS-2,一个用于高带宽语音合成的大规模语音数据集。该数据集源自 LibriVox 有声书,包含约 36.7k 小时的英语语音用于 22.05 kHz 训练,以及 31.7k 小时用于 44.1 kHz 训练。我们展示了数据处理流程,包括带宽估计、分段、文本预处理和多说话人检测。该数据集附有由我们的流程生成的详细语句和有声书元数据,使研究人员能够应用数据质量滤波器来适配不同用途。实验结果表明,我们的数据流程和所得到的数据集能够促进在高带宽下训练高质量的零样本文本转语音(TTS)模型。
引用
@article{arxiv.2506.04152,
title = {HiFiTTS-2: A Large-Scale High Bandwidth Speech Dataset},
author = {Ryan Langman and Xuesong Yang and Paarth Neekhara and Shehzeen Hussain and Edresson Casanova and Evelina Bakhturina and Jason Li},
journal= {arXiv preprint arXiv:2506.04152},
year = {2025}
}
备注
Accepted in Interspeech 2025