中文

DeepFense:面向鲁棒深度伪造音频检测的统一、模块化框架

声音 2026-04-10 v1 音频与语音处理

摘要

语音深度伪造检测是一个已建立的研究领域,涉及不同的模型、数据集和训练策略。然而,缺乏标准化的实现和评估协议限制了可重复性、基准测试和跨研究的比较。在本工作中,我们present了DeepFense,一个综合性、开源的PyTorch工具包,集成了最新的架构、损失函数和数据增强管道,包含超过100个配方。通过DeepFense,我们对超过400个模型进行了大规模评估。我们的发现表明, carefully curated的训练数据可以改善跨域泛化,但预训练前端特征提取器的选择主导了整体性能差异。关键的是,我们展示了高性能模型在音频质量、说话人性别和语言方面的严重偏见。DeepFense预计将促进实际部署,提供必要的工具来解决公平训练数据选择和前端微调问题。

关键词

引用

@article{arxiv.2604.08450,
  title  = {DeepFense: A Unified, Modular, and Extensible Framework for Robust Deepfake Audio Detection},
  author = {Yassine El Kheir and Arnab Das and Yixuan Xiao and Xin Wang and Feidi Kallel and Enes Erdem Erdogan and Ngoc Thang Vu and Tim Polzehl and Sebastian Moeller},
  journal= {arXiv preprint arXiv:2604.08450},
  year   = {2026}
}

备注

Deepfense Toolkit