中文

CN-Celeb:一个具有挑战性的中文说话人识别数据集

音频与语音处理 2019-11-06 v1 计算与语言 声音

摘要

近来,研究者设定了一个雄心勃勃的目标,即在非受限条件下进行说话人识别,其中环境、信道与情绪的变化可以是任意的。然而,大多数公开可用数据集是在受限环境下收集的,即噪声小且信道变化有限。这些数据集往往给出过于乐观的性能,不能满足非受限条件下说话人识别研究的需求。本文中,我们提出 CN-Celeb,一个大规模“野外”收集的说话人识别数据集。该数据集包含来自 1000 名中国名人的超过 130,000 条语音,并涵盖现实世界中的 11 种不同体裁。使用两种最先进的说话人识别方法(i-vector 与 x-vector)进行的实验表明,在 CN-Celeb 上的性能远逊于在广泛使用的说话人识别数据集 VoxCeleb 上获得的性能。该结果表明,在真实生活条件下,现有技术的性能可能远比设想的要差。我们的数据库对研究者免费开放,可从 http://project.cslt.org 下载。

关键词

引用

@article{arxiv.1911.01799,
  title  = {CN-CELEB: a challenging Chinese speaker recognition dataset},
  author = {Yue Fan and Jiawen Kang and Lantian Li and Kaicheng Li and Haolin Chen and Sitong Cheng and Pengyuan Zhang and Ziya Zhou and Yunqi Cai and Dong Wang},
  journal= {arXiv preprint arXiv:1911.01799},
  year   = {2019}
}