中文

IDLAB VoxCeleb说话人识别挑战赛2020系统描述

音频与语音处理 2020-10-26 v1 声音

摘要

在本技术报告中,我们描述了IDLAB在VoxCeleb说话人识别挑战赛2020(VoxSRC-20)有监督和无监督说话人验证赛道上的最高分提交方案。对于有监督验证赛道,我们训练了6个最先进的ECAPA-TDNN系统和4个基于Resnet34且具结构变化的系统。在所有模型上我们应用了大间隔微调策略,该策略通过使用更长的训练语句使训练过程能够使用更高的间隔惩罚。此外,我们使用质量感知分数校准,在校准系统中引入质量度量,以在不同语句条件下生成更一致的分数。应用了两种增强手段的所有系统融合后在开放和封闭有监督验证赛道上获得第一名。无监督系统通过对比学习训练。随后通过对训练嵌入的迭代聚类生成伪标签,从而可使用有监督技术。该流程在无监督赛道上取得获胜提交,其性能正逼近有监督训练。

关键词

引用

@article{arxiv.2010.12468,
  title  = {The IDLAB VoxCeleb Speaker Recognition Challenge 2020 System Description},
  author = {Jenthe Thienpondt and Brecht Desplanques and Kris Demuynck},
  journal= {arXiv preprint arXiv:2010.12468},
  year   = {2020}
}