中文

使用深度学习框架的环境声音深度伪造检测

声音 2026-05-04 v2 人工智能

摘要

在本文中,我们提出了一个用于环境声音深度伪造检测(ESDD)的深度学习框架——即识别输入音频录音中的声场景和声事件是否为伪造的任务。为此,我们进行了广泛的实验,以探索单个频谱图、广泛的网络架构和预训练模型、频谱图或网络架构的集成如何影响 ESDD 任务性能。在 EnvSDD 和 ESDD-Challenge-TestSet 基准数据集上的实验结果表明,检测声场景的深度伪造音频与检测声事件的深度伪造音频应被视为独立的任务。我们还指出,对于 ESDD 任务,微调预训练模型的方法比从头训练模型更有效。最终,我们表现最佳的模型通过所提出的三阶段训练策略从预训练 WavLM 模型微调而来,在 EnvSDD 测试子集上实现了 0.98 的准确率、0.95 的 F1 分数和 0.99 的 AuC,在 ESDD-Challenge-TestSet 数据集上实现了 0.88 的准确率、0.77 的 F1 分数和 0.92 的 AuC。

关键词

引用

@article{arxiv.2604.19652,
  title  = {Environmental Sound Deepfake Detection Using Deep-Learning Framework},
  author = {Lam Pham and Khoi Vu and Dat Tran and Phat Lam and Vu Nguyen and David Fischinger and Son Le},
  journal= {arXiv preprint arXiv:2604.19652},
  year   = {2026}
}