音频深度伪造检测的对抗性攻击:基准测试与比较研究
声音
2025-09-10 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
生成式 AI 的广泛应用已在制作高度逼真的深度伪造内容方面取得显著成功,对各种语音生物识别应用构成了严重威胁,包括说话人验证、语音生物识别、音频会议以及刑事调查。为对抗这一趋势,已提出了若干最先进 (SoTA) 音频深度伪造检测 (ADD) 方法,以识别生成式 AI 的特征,从而区分真实与深度伪造音频。然而,这些方法的有效性因抗探forensic (AF) 攻击而受到严重削弱,这些攻击通过统计修改(如升调、滤波、噪声添加和量化)和基于优化的攻击(如 FGSM、PGD、C&W 和 DeepFool)来隐藏生成特征。本文调查了 SoTA ADD 方法,并提供了比较分析,突出其在暴露深度伪造特征方面的有效性,以及在对抗条件下的脆弱性。我们对 ADD 方法在五个深度伪造基准数据集上进行了广泛评估,采用 raw 方法和 spectrogram-based 方法两个类别。这种比较分析有助于更深入地理解 SoTA ADD 方法在应对多样化 AF 攻击方面的优势与局限。它不仅揭示了 ADD 方法的脆弱性,也为设计更健壮、更通用的检测器提供了指导,以应用于实际语音生物识别场景。进一步指导了未来研究在开发能够有效抵御不断演变的 AF 技术的自适应防御策略方面的工作。
引用
@article{arxiv.2509.07132,
title = {Adversarial Attacks on Audio Deepfake Detection: A Benchmark and Comparative Study},
author = {Kutub Uddin and Muhammad Umar Farooq and Awais Khan and Khalid Mahmood Malik},
journal= {arXiv preprint arXiv:2509.07132},
year = {2025}
}