中文

DKU-MSXF 用于 VoxCeleb 说话人识别挑战赛 2023 的说话人确认系统

音频与语音处理 2023-08-21 v1 声音

摘要

本文为 DKU-MSXF 系统参加 VoxCeleb 说话人识别挑战赛 2023(VoxSRC-23) track1、track2 和 track3 的系统描述。对于 Track 1,我们采用基于 ResNet 的网络结构进行训练。通过构建跨年龄 QMF 训练集,系统性能获得显著提升。对于 Track 2,我们继承了 Track 1 的预训练模型,并引入 VoxBlink-clean 数据集进行混合训练。与 Track 1 相比,融合 VoxBlink-clean 数据的模型相对性能提升超过 10%。对于 Track 3 半监督域适应任务,采用了一种基于三阈值与子中心净化的新型伪标签方法来实现域适应。最终提交结果在 task1 中 mDCF 为 0.1243,在 Track 2 中 mDCF 为 0.1165,在 Track 3 中 EER 为 4.952%。

关键词

引用

@article{arxiv.2308.08766,
  title  = {The DKU-MSXF Speaker Verification System for the VoxCeleb Speaker Recognition Challenge 2023},
  author = {Ze Li and Yuke Lin and Xiaoyi Qin and Ning Jiang and Guoqing Zhao and Ming Li},
  journal= {arXiv preprint arXiv:2308.08766},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2210.05092