中文

用于2020 VoxCeleb说话人识别挑战赛的xx205系统

声音 2020-11-03 v1 计算与语言 音频与语音处理

摘要

本报告描述了提交至2020 VoxCeleb说话人识别挑战赛(VoxSRC)第一和第二赛道、并在两个赛道均排名第二的系统。探讨了系统流水线的三个关键点:(1)研究包括ResNet、Res2Net和双路径网络(DPN)在内的多种CNN架构以提取x-vectors;(2)使用复合角间隔softmax损失训练说话人模型;(3)应用分数归一化与系统融合以提升性能。在VoxSRC-20评估集上测得,所提交的最佳系统在闭集条件赛道1中取得EER为3.808%3.808\%、MinDCF为0.19580.1958,在开集条件赛道2中分别取得EER为3.798%3.798\%、MinDCF为0.19420.1942

关键词

引用

@article{arxiv.2011.00200,
  title  = {The xx205 System for the VoxCeleb Speaker Recognition Challenge 2020},
  author = {Xu Xiang},
  journal= {arXiv preprint arXiv:2011.00200},
  year   = {2020}
}