中文

End-to-end Audio Deepfake Detection from RAW Waveforms: a RawNet-Based Approach with Cross-Dataset Evaluation

声音 2025-05-01 v2 计算机视觉与模式识别 音频与语音处理

摘要

音频深度伪造代表了数字安全和信任日益增长的威胁,利用先进的生成模型产生与真实人声高度相似的合成语音。面对开放世界条件下的检测挑战,在这种情况下,测试期间遇到的欺骗方法可能与训练期间看到的不同。在本工作中,我们提出了一个从原始波形直接 operate 的音频深度伪造检测的端到端深度学习框架。我们的模型RawNetLite是一个轻量级卷积-循环网络,旨在捕获无需手工预处理的频谱和时域特征。为增强鲁棒性,我们引入一种训练策略,组合来自多个领域的数据并采用焦点损失(Focal Loss)以强调难以分类或模糊样本。我们进一步演示,纳入基于编解码器的操纵并应用波形级别的音频增强(例如,升高音调、噪声和时间拉伸)可在真实声学条件下显著提高泛化能力。该模型在领域内数据(FakeOrReal)上实现超过99.7%的F1分数和0.25%的EER,在具有挑战性的域外测试集(AVSpoof2021 + CodecFake)上实现最高83.4%的F1和16.4%的EER。这些发现凸显了多样化训练数据、量身定制的目标函数和音频增强在构建韧性和可泛化的音频伪造检测器方面的重要性。代码和预训练模型均可用于 https://iplab.dmi.unict.it/mfs/Deepfakes/PaperRawNet2025/。

关键词

引用

@article{arxiv.2504.20923,
  title  = {End-to-end Audio Deepfake Detection from RAW Waveforms: a RawNet-Based Approach with Cross-Dataset Evaluation},
  author = {Andrea Di Pierno and Luca Guarnera and Dario Allegra and Sebastiano Battiato},
  journal= {arXiv preprint arXiv:2504.20923},
  year   = {2025}
}