GTSinger:面向所有唱歌任务的全球多技术带真实音乐记谱的唱声语料库
音频与语音处理
2026-02-17 v8 计算与语言
声音
摘要
高质量且多任务唱声数据集的稀缺性显著阻碍了多样化可控且个性化唱歌任务的开发,因为现有唱声数据集存在质量较低、语言和歌手多样性有限、缺乏多技术信息和真实音乐记谱,以及任务适用性差等问题。为解决这些问题,我们提出了 GTSinger——一个规模宏大、覆盖多种唱歌技巧、免费且高质量的唱声语料库,配备真实音乐记谱,旨在服务于所有唱歌任务,并附带其基准测试。具体而言:(1)我们收集了 80.59 小时的高质量唱声录音,构成目前最大的录制唱声数据集;(2)20 位专业歌手代表九种广泛使用的语言,提供多样化的音色与风格;(3)我们提供了六种常用唱歌技巧的受控比较和音素级标注,有助于技巧建模与控制;(4)GTSinger 提供真实音乐记谱,辅助现实世界的音乐作曲;(5)唱声录音伴随手动音素到音频的对齐、全局风格标签,以及 16.16 小时的配对语音,用于各种唱歌任务。此外,为便于使用 GTSinger,我们开展了四项基准实验:技巧可控唱声合成、技巧识别、风格迁移以及语音到唱声转换。演示可见于 http://aaronz345.github.io/GTSingerDemo/。我们提供语料库及处理数据和执行基准测试的代码,地址为 https://huggingface.co/datasets/AaronZ345/GTSinger 和 https://github.com/AaronZ345/GTSinger。
引用
@article{arxiv.2409.13832,
title = {GTSinger: A Global Multi-Technique Singing Corpus with Realistic Music Scores for All Singing Tasks},
author = {Yu Zhang and Changhao Pan and Wenxiang Guo and Ruiqi Li and Zhiyuan Zhu and Jialei Wang and Wenhao Xu and Jingyu Lu and Zhiqing Hong and Chuxin Wang and LiChao Zhang and Jinzheng He and Ziyue Jiang and Yuxin Chen and Chen Yang and Jiecheng Zhou and Xinyu Cheng and Zhou Zhao},
journal= {arXiv preprint arXiv:2409.13832},
year = {2026}
}
备注
Accepted by NeurIPS 2024 (Spotlight)