JukeBox:一个多语言歌手识别数据集
音频与语音处理
2020-08-11 v1 机器学习
声音
摘要
与文本无关的说话人识别系统依赖于成功编码语音音高、强度和音色等语音因素以取得良好性能。此类系统大多使用口语语音或日常对话语音数据进行训练和评估。然而,口语语音所展现的说话人动态范围有限,从而限制了所得说话人识别模型的效用。相比之下,歌唱语音覆盖了更广的发声与环境因子,因此可用于评估说话人识别系统的鲁棒性。但是,现有多数说话人识别数据集仅关注口语语音。相比之下,适用于说话人识别研究的带标注歌唱语音数据严重短缺。为解决此问题,我们构建了 \textit{JukeBox}——一个带有歌手身份、性别和语言标注的多语言歌唱语音说话人识别数据集。我们使用当前最先进的方法证明了仅用口语语音训练的模型在歌唱语音上执行说话人识别的困难性。我们还评估了性别与语言对说话人识别性能的影响,涵盖口语与歌唱语音数据。完整的 \textit{JukeBox} 数据集可访问 http://iprobe.cse.msu.edu/datasets/jukebox.html。
引用
@article{arxiv.2008.03507,
title = {JukeBox: A Multilingual Singer Recognition Dataset},
author = {Anurag Chowdhury and Austin Cozzo and Arun Ross},
journal= {arXiv preprint arXiv:2008.03507},
year = {2020}
}
备注
INTERSPEECH 2020 (To Appear)