深度伪造语音检测的后训练方法
音频与语音处理
2025-10-22 v4
摘要
我们介绍一种后训练方法,通过桥接通用预训练和领域特定微调,为深度伪造语音检测适配自监督学习 (SSL) 模型。我们提出 AntiDeepfake 模型系列,采用包含超过 56,000 小时真实语音和 18,000 小时具有 various 伪造语音 artifacts 的多语言语音数据集进行后训练。实验结果表明,这些后训练模型在检测未见的深度伪造语音方面已具备强大的鲁棒性和泛化能力。当这些模型在 Deepfake-Eval-2024 数据集上进一步微调时,它们一致超越了不采用后训练的现有最先进检测器。模型检查点和源代码已在线提供。
引用
@article{arxiv.2506.21090,
title = {Post-training for Deepfake Speech Detection},
author = {Wanying Ge and Xin Wang and Xuechen Liu and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2506.21090},
year = {2025}
}
备注
Corrected previous implementation of EER calculation. Slight numerical changes in some of the results