微软用于 VoxCeleb 说话人识别挑战赛 2022 的系统
声音
2022-09-26 v1
摘要
在本报告中,我们描述了提交用于 VoxCeleb 说话人识别挑战赛 2022 (VoxSRC-22) 第二赛道系统。我们融合了多种表现良好的模型,涵盖从监督模型到自监督学习(SSL)预训练模型。使用 VoxCeleb-2 开发数据训练的监督模型包括极深结构中的 ECAPA-TDNN 与 Res2Net。SSL 预训练模型 wav2vec 与 wavLM 使用多达百万小时的大规模无标签语音数据训练。这些模型与 ECAPA-TDNN 级联并进一步以监督方式微调以提取说话人表征。全部 13 个模型均应用分数归一化与校准,随后融合进提交系统。我们还在校准阶段探索了音频质量度量如时长、SNR、T60 与 MOS。最佳提交系统在 VoxSRC-22 评估集上取得 minDCF 0.073 与 EER 1.436%。
引用
@article{arxiv.2209.11266,
title = {The Microsoft System for VoxCeleb Speaker Recognition Challenge 2022},
author = {Gang Liu and Tianyan Zhou and Yong Zhao and Yu Wu and Zhuo Chen and Yao Qian and Jian Wu},
journal= {arXiv preprint arXiv:2209.11266},
year = {2022}
}
备注
3 pages, 3 tables, VoxSRC2022