CN-Celeb:多场景说话人识别
声音
2021-11-25 v2 音频与语音处理
摘要
说话人识别的研究正扩展到应对真实条件下的脆弱性,其中场景失配或许最具挑战性,例如使用朗读语音注册而用对话或歌唱音频测试。这种失配导致了复杂且复合的会话间差异,包括内在的(即说话风格、生理状态)与外在的(即录音设备、背景噪声)。遗憾的是,现有的少数多场景语料库不仅规模有限,而且是在受控条件下录制的,无法支撑关于多场景问题的结论性研究。在本工作中,我们首次发布了 CN-Celeb,一个大规模多场景语料库,包含 3000 名说话人在 11 种不同场景下的真实语音片段。其次,利用该数据集,我们对多场景现象进行了全面研究,特别是多场景挑战对说话人识别的影响,以及使用该新数据集进行多场景训练所带来的性能提升。
引用
@article{arxiv.2012.12468,
title = {CN-Celeb: multi-genre speaker recognition},
author = {Lantian Li and Ruiqi Liu and Jiawen Kang and Yue Fan and Hao Cui and Yunqi Cai and Ravichander Vipperla and Thomas Fang Zheng and Dong Wang},
journal= {arXiv preprint arXiv:2012.12468},
year = {2021}
}
备注
submitted to Speech Communication