中文

用于 VoxCeleb 说话人识别挑战赛 2022 的 DKU-腾讯系统

声音 2022-10-12 v1 音频与语音处理

摘要

本文是用于 VoxCeleb 说话人识别挑战赛 2022 (VoxSRC22) 的 DKU-腾讯系统的系统描述。在本次挑战赛中,我们专注于 track1 和 track3。对于 track1,采用多个骨干网络来提取帧级特征。由于 track1 侧重于跨年龄场景,我们采用跨年龄测试对并执行 QMF 来校准分数。基于幅值的质量度量取得了大幅提升。对于 track3,即半监督域适应任务,采用伪标签方法进行域适应。考虑到聚类中的噪声标签,ArcFace 被 Sub-center ArcFace 替代。最终提交在 task1 中实现了 0.107 的 mDCF,在 task3 中实现了 7.135% 的 EER。

关键词

引用

@article{arxiv.2210.05092,
  title  = {The DKU-Tencent System for the VoxCeleb Speaker Recognition Challenge 2022},
  author = {Xiaoyi Qin and Na Li and Yuke Lin and Yiwei Ding and Chao Weng and Dan Su and Ming Li},
  journal= {arXiv preprint arXiv:2210.05092},
  year   = {2022}
}