WhispSynth:通过实数据精选与无音高生成框架扩展多语言Whisper语料库
声音
2026-03-17 v1
摘要
Whisper生成受数据收集难度的制约。由于嗓声发声的声学振幅较低,高保真录音具有较大的挑战性。本文引入WhispSynth,一个大规模多语言语料库,通过一种新型的高保真生成框架构建。具体而言,我们提出一种集成可微数字信号处理(DDSP)无音高方法与文本转语音(TTS)模型的管道。该框架将包括我们新构建的WhispNJU数据集在内的全套资源,转化为来自479名说话者的118小时高保真嗓声语音。与标准合成或噪声真实数据不同,我们的数据引擎忠实地保留了源语音色彩和语言内容,同时确保声学一致性,为文本到嗓声研究提供了稳健的基础。实验结果表明,WhispSynth的质量显著高于现有语料库。此外,我们的CosyWhisper使用WhispSynth调优后,实现了与真实样本相当的语音自然度。官方实现及相关资源可访问https://github.com/tan90xx/cosywhisper获取。
引用
@article{arxiv.2603.14853,
title = {WhispSynth: Scaling Multilingual Whisper Corpus through Real Data Curation and A Novel Pitch-free Generative Framework},
author = {Tianyi Tan and Jiaxin Ye and Yuanming Zhang and Xiaohuai Le and Xianjun Xia and Chuanzeng Huang and Jing Lu},
journal= {arXiv preprint arXiv:2603.14853},
year = {2026}
}
备注
Under Review