中文

CN-Celeb:多场景说话人识别

声音 2021-11-25 v2 音频与语音处理

摘要

说话人识别的研究正扩展到应对真实条件下的脆弱性,其中场景失配或许最具挑战性,例如使用朗读语音注册而用对话或歌唱音频测试。这种失配导致了复杂且复合的会话间差异,包括内在的(即说话风格、生理状态)与外在的(即录音设备、背景噪声)。遗憾的是,现有的少数多场景语料库不仅规模有限,而且是在受控条件下录制的,无法支撑关于多场景问题的结论性研究。在本工作中,我们首次发布了 CN-Celeb,一个大规模多场景语料库,包含 3000 名说话人在 11 种不同场景下的真实语音片段。其次,利用该数据集,我们对多场景现象进行了全面研究,特别是多场景挑战对说话人识别的影响,以及使用该新数据集进行多场景训练所带来的性能提升。

关键词

引用

@article{arxiv.2012.12468,
  title  = {CN-Celeb: multi-genre speaker recognition},
  author = {Lantian Li and Ruiqi Liu and Jiawen Kang and Yue Fan and Hao Cui and Yunqi Cai and Ravichander Vipperla and Thomas Fang Zheng and Dong Wang},
  journal= {arXiv preprint arXiv:2012.12468},
  year   = {2021}
}

备注

submitted to Speech Communication