中文

IDLAB VoxCeleb说话人识别挑战赛2021系统描述

音频与语音处理 2021-09-10 v1 声音

摘要

本技术报告描述了IDLab在VoxCeleb说话人识别挑战赛2021(VoxSRC-21)赛道1和赛道2的提交系统。该说话人验证竞赛聚焦于短时长测试录音和跨语言试次。目前,时延神经网络(TDNN)和残差网络(ResNet)在说话人验证中均取得了最先进的结果。我们在最终提交中选择了混合架构的系统融合。一个ECAPA-TDNN基线被增强了二维卷积前端,以将基于ResNet模型的一些强特性迁移到这种混合CNN-TDNN架构中。类似地,我们在SE-ResNet架构中引入了绝对频率位置信息。所有模型均采用一种特殊的小批量数据采样技术进行训练,该技术构建的小批量数据在说话人内部变异性的层面上对系统最具挑战性。这种说话人内部变异性主要由说话人话语之间的语言和背景条件差异引起。通过在基于逻辑回归的系统校准中引入一个二值跨语言试次特征,进一步补偿了跨语言对说话人验证分数的影响。最终的系统融合包含两个ECAPA CNN-TDNN和三个增强了频率位置信息的SE-ResNet,在VoxSRC-21排行榜上赛道1和赛道2均获得第三名,minDCF分别为0.1291和0.1313。

关键词

引用

@article{arxiv.2109.04070,
  title  = {The IDLAB VoxCeleb Speaker Recognition Challenge 2021 System Description},
  author = {Jenthe Thienpondt and Brecht Desplanques and Kris Demuynck},
  journal= {arXiv preprint arXiv:2109.04070},
  year   = {2021}
}

备注

arXiv admin note: substantial text overlap with arXiv:2104.02370