XWSB:利用 XLS-R 和 WavLM 结合 SLS 分类器检测系统的 SVDD 2024 挑战赛混合系统
声音
2024-10-03 v1 音频与语音处理
摘要
本文介绍了在 SVDD 2024 挑战赛中使用的模型结构。SVDD 2024 挑战赛是今年首次引入的。由于非正式的语音语调和多变的语速,歌声深度伪造检测(SVDD)面临着复杂性。在本文中,我们提出了 XWSB 系统,它在 SVDD 挑战中实现了 SOTA 性能。XWSB 代表 XLS-R、WavLM 和 SLS 混合,表示为了 SVDD 而对这些技术进行的集成。具体而言,我们使用了在 ASVspoof DF 数据集上表现最佳的模型结构 XLS-R&SLS,并将 SLS 应用于 WavLM 以形成 WavLM&SLS 结构。最后,我们将两个模型集成以形成 XWSB 系统。实验结果表明,我们的系统在 SVDD 挑战中展现出先进的识别能力,具体在 CtrSVDD 赛道上实现了 2.32% 的 EER。代码和数据可在 https://github.com/QiShanZhang/XWSB_for_ SVDD2024 找到。
引用
@article{arxiv.2409.18558,
title = {XWSB: A Blend System Utilizing XLS-R and WavLM with SLS Classifier detection system for SVDD 2024 Challenge},
author = {Qishan Zhang and Shuangbing Wen and Fangke Yan and Tao Hu and Jun Li},
journal= {arXiv preprint arXiv:2409.18558},
year = {2024}
}