用于 VoxCeleb 说话人识别挑战赛 2022 的 DKU-腾讯系统
声音
2022-10-12 v1 音频与语音处理
摘要
本文是用于 VoxCeleb 说话人识别挑战赛 2022 (VoxSRC22) 的 DKU-腾讯系统的系统描述。在本次挑战赛中,我们专注于 track1 和 track3。对于 track1,采用多个骨干网络来提取帧级特征。由于 track1 侧重于跨年龄场景,我们采用跨年龄测试对并执行 QMF 来校准分数。基于幅值的质量度量取得了大幅提升。对于 track3,即半监督域适应任务,采用伪标签方法进行域适应。考虑到聚类中的噪声标签,ArcFace 被 Sub-center ArcFace 替代。最终提交在 task1 中实现了 0.107 的 mDCF,在 task3 中实现了 7.135% 的 EER。
引用
@article{arxiv.2210.05092,
title = {The DKU-Tencent System for the VoxCeleb Speaker Recognition Challenge 2022},
author = {Xiaoyi Qin and Na Li and Yuke Lin and Yiwei Ding and Chao Weng and Dan Su and Ming Li},
journal= {arXiv preprint arXiv:2210.05092},
year = {2022}
}