ReturnZero 团队用于 VoxCeleb 说话人识别挑战赛 2022 的系统
音频与语音处理
2022-09-22 v1 人工智能
机器学习
声音
摘要
在本文中,我们描述了 RTZR 团队在 VoxCeleb 说话人识别挑战赛 2022(VoxSRC-22)封闭数据集说话人验证 Track 1 中得分最高的提交方案。性能最佳的系统的 7 个模型融合,包含 3 种不同类型的模型架构。我们专注于训练模型以学习额外时间信息。因此,所有模型均使用每 utterance 4–6 秒的帧进行训练。此外,我们对部分融合模型应用了在以往挑战赛中表现良好的大间隔微调(Large Margin Fine-tuning)策略。在评估过程中,我们应用了带自适应对称归一化(AS-Norm)与矩阵分数平均(MSA)的打分方法。最后,我们使用逻辑回归混合各模型以融合所有训练模型。最终提交在 VoxSRC22 测试集上取得了 0.165 DCF 与 2.912% EER。
引用
@article{arxiv.2209.10147,
title = {The ReturnZero System for VoxCeleb Speaker Recognition Challenge 2022},
author = {Sangwon Suh and Sunjong Park},
journal= {arXiv preprint arXiv:2209.10147},
year = {2022}
}
备注
4 pages, 4 tables, technical report