SingNet:迈向大规模、多样化且自然场景下的歌声数据集
声音
2025-05-15 v1 音频与语音处理
摘要
缺乏公开可用的大规模且多样化的数据集,长期以来一直是歌声应用(如 Singing Voice Synthesis (SVS) 和 Singing Voice Conversion (SVC))的重要瓶颈。为了解决这个问题,我们提出了 SingNet,一个广泛、多样化且自然场景下的歌声数据集。具体而言,我们提出了一种数据处理流水线,从互联网上的样本包和歌曲中提取即用型训练数据,构成了 3000 小时包含各种语言和风格的歌声。此外,为了促进 SingNet 的使用并展示其有效性,我们基于收集的歌声数据在 Wav2vec2、BigVGAN 和 NSF-HiFiGAN 上预训练并开源了各种 state-of-the-art (SOTA) 模型。我们还在 Automatic Lyric Transcription (ALT)、Neural Vocoder 和 Singing Voice Conversion (SVC) 上进行了基准实验。音频演示位于:https://singnet-dataset.github.io/。
引用
@article{arxiv.2505.09325,
title = {SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset},
author = {Yicheng Gu and Chaoren Wang and Junan Zhang and Xueyao Zhang and Zihao Fang and Haorui He and Zhizheng Wu},
journal= {arXiv preprint arXiv:2505.09325},
year = {2025}
}