中文

ReturnZero 团队用于 VoxCeleb 说话人识别挑战赛 2022 的系统

音频与语音处理 2022-09-22 v1 人工智能 机器学习 声音

摘要

在本文中,我们描述了 RTZR 团队在 VoxCeleb 说话人识别挑战赛 2022(VoxSRC-22)封闭数据集说话人验证 Track 1 中得分最高的提交方案。性能最佳的系统的 7 个模型融合,包含 3 种不同类型的模型架构。我们专注于训练模型以学习额外时间信息。因此,所有模型均使用每 utterance 4–6 秒的帧进行训练。此外,我们对部分融合模型应用了在以往挑战赛中表现良好的大间隔微调(Large Margin Fine-tuning)策略。在评估过程中,我们应用了带自适应对称归一化(AS-Norm)与矩阵分数平均(MSA)的打分方法。最后,我们使用逻辑回归混合各模型以融合所有训练模型。最终提交在 VoxSRC22 测试集上取得了 0.165 DCF 与 2.912% EER。

关键词

引用

@article{arxiv.2209.10147,
  title  = {The ReturnZero System for VoxCeleb Speaker Recognition Challenge 2022},
  author = {Sangwon Suh and Sunjong Park},
  journal= {arXiv preprint arXiv:2209.10147},
  year   = {2022}
}

备注

4 pages, 4 tables, technical report