中文

基于域平衡难原型挖掘与语言相关分数归一化的跨语言说话人验证

音频与语音处理 2020-11-03 v2 计算与语言 声音

摘要

本文描述了IDLab在2020年短时长说话人验证(SdSV)挑战赛文本无关任务中得分最高的提交方案。该挑战的主要困难在于潜在跨语言试对之间不同程度的语音重叠,以及领域内DeepMine Farsi训练数据的有限可用性。我们引入域平衡难原型挖掘来微调基于最先进的ECAPA-TDNN x-vector的说话人嵌入提取器。该样本挖掘技术有效利用流行AAM-softmax损失函数的说话人原型之间的说话人距离,构建在域级别上平衡的困难训练批次。为增强跨语言试对的打分,我们提出了一种语言相关的s-norm分数归一化。冒名者队列仅包含来自Farsi目标域的数据,其模拟注册数据始终为Farsi。在基于高斯后端语言模型检测到测试说话人嵌入包含英语的情况下,从最大期望冒名者均值分数中减去基于AAM-softmax说话人原型确定的跨语言补偿偏移。对五个具有微小拓扑调整的系统进行融合,在SdSVC评估集上分别得到最终的MinDCF和EER为0.065和1.45%。

关键词

引用

@article{arxiv.2007.07689,
  title  = {Cross-Lingual Speaker Verification with Domain-Balanced Hard Prototype Mining and Language-Dependent Score Normalization},
  author = {Jenthe Thienpondt and Brecht Desplanques and Kris Demuynck},
  journal= {arXiv preprint arXiv:2007.07689},
  year   = {2020}
}

备注

proceedings of INTERSPEECH 2020