Kriston AI 用于 VoxCeleb 说话人识别挑战赛 2022 的系统
音频与语音处理
2022-09-26 v1 声音
摘要
本技术报告描述了我们用于 VoxCeleb Speaker Recognition Challenge 2022(VoxSRC-22)第 1、2 和 4 赛道的系统。通过组合多个 ResNet 变体,我们第 1 赛道的提交取得了 0.090 的 minDCF 与 1.401% 的 EER。通过进一步引入三个微调的预训练模型,我们第 2 赛道的提交取得了 0.072 的 minDCF 与 1.119% 的 EER。对于第 4 赛道,我们的系统由语音活动检测(VAD)、说话人嵌入提取、聚合层次聚类(AHC)以及基于贝叶斯隐马尔可夫模型的再聚类步骤,加上重叠语音检测与处理组成。我们第 4 赛道的提交取得了 4.86% 的说话人日志错误率(DER)。各提交在其对应赛道均排名第 2。
引用
@article{arxiv.2209.11433,
title = {The Kriston AI System for the VoxCeleb Speaker Recognition Challenge 2022},
author = {Qutang Cai and Guoqiang Hong and Zhijian Ye and Ximin Li and Haizhou Li},
journal= {arXiv preprint arXiv:2209.11433},
year = {2022}
}
备注
System description of VoxSRC 2022: track 1, 2 and 4