中文

针对音频深度伪造检测的重放攻击

声音 2025-06-03 v2 人工智能 音频与语音处理

摘要

我们展示了重放攻击如何削弱音频深度伪造检测:通过播放和重录通过各种扬声器和麦克风的深度伪造音频,使生成的样本对检测模型而言看起来更像真实音频。为更详细地研究这一现象, 我们引入了 ReplayDF 数据集,源自 M-AILABS 和 MLAAD,包含来自 109 种说话人-麦克风组合的录音,覆盖六种语言和四种 TTS 模型。数据集包含多种声学条件,其中一些条件对检测具有挑战性。我们分析了六个开源检测模型在五个数据集上的表现,发现其高度脆弱,性能最好的 W2V2-AASIST 模型的平均错误率(EER)从 4.7% 飙升至 18.2%。即使进行自适应房间脉冲响应(RIR)重新训练,性能仍受影响, EER 为 11.0%。我们将 ReplayDF 提供给非商业研究用途。

关键词

引用

@article{arxiv.2505.14862,
  title  = {Replay Attacks Against Audio Deepfake Detection},
  author = {Nicolas Müller and Piotr Kawa and Wei-Herng Choong and Adriana Stan and Aditya Tirumala Bukkapatnam and Karla Pizzi and Alexander Wagner and Philip Sperl},
  journal= {arXiv preprint arXiv:2505.14862},
  year   = {2025}
}