通用音频深度伪造检测
音频与语音处理
2025-07-03 v1 声音
摘要
本文提出了旨在增强音频深度伪造检测模型泛化能力的全面研究。我们探讨了各种预训练主干网络(包括 Wav2Vec2、WavLM 和 Whisper)在多样化数据集上的表现,涵盖来自 ASVspoof 挑战赛的数据集以及其他来源的数据集。我们的实验关注不同数据增强策略和损失函数对模型性能的影响。本研究的结果表明,音频深度伪造检测模型的泛化能力得到了显著提升,甚至超过了 ASVspoof 5 挑战赛中排名靠前的单一系统的性能。这一研究为优化音频模型以实现更稳健的深度伪造检测,以及推动该关键领域的未来研究提供了宝贵的见解。
引用
@article{arxiv.2507.01750,
title = {Generalizable Detection of Audio Deepfakes},
author = {Jose A. Lopez and Georg Stemmer and Héctor Cordourier Maruri},
journal= {arXiv preprint arXiv:2507.01750},
year = {2025}
}
备注
8 pages, 3 figures