探索WavLM作为语音防伪与深度伪造检测的后端
音频与语音处理
2025-06-25 v1 机器学习
声音
摘要
本文描述了我们提交给ASVspoof 5挑战Track 1:语音深度伪造检测-开放条件的系统。该任务包含一个独立的语音深度伪造(真人 vs 伪造)检测任务。最近,大规模自监督模型已成为自动语音识别(ASR)和其他语音处理任务中的标准。因此,我们利用预训练的WavLM作为前端模型,并使用不同的后端技术对其表示进行池化。该完整框架仅使用挑战训练数据集进行微调,类似于封闭条件。除此之外,我们采用通过MUSAN噪声和RIR数据集添加噪声和混响的数据增强技术。我们还实验了编解码器增强以提高方法性能。最终,我们使用Bosaris工具包进行得分校准和系统融合以获得更好的Cllr分数。我们的融合系统实现了0.0937 minDCF、3.42% EER、0.1927 Cllr和0.1375 actDCF。
引用
@article{arxiv.2409.05032,
title = {Exploring WavLM Back-ends for Speech Spoofing and Deepfake Detection},
author = {Theophile Stourbe and Victor Miara and Theo Lepage and Reda Dehak},
journal= {arXiv preprint arXiv:2409.05032},
year = {2025}
}