中文

超越身份认知:深度伪造音频检测的通用方法

声音 2025-05-13 v1 音频与语音处理 信号处理

摘要

深度伪造音频因其潜在的社交工程、欺诈和身份滥用风险,正成为数字安全的日益增长威胁。然而,现有检测模型因隐式身份泄露问题,在数据集之间表现差异较大,即模型不小心学习了说话人特定特征而非操纵痕迹。据我们所知,这是首次明确分析和解决音频深度伪造检测领域身份泄露问题的研究。本文提出一种身份无关的音频深度伪造检测框架,通过鼓励模型专注于伪造相关痕迹而非对说话人特征过拟合来缓解身份泄露。我们的做法利用伪造检测模块(Artifact Detection Modules, ADM)在时域和频域上隔离合成痕迹,以增强跨数据集的泛化能力。我们引入新颖的动态伪造生成技术,包括频域置换、时域操作和背景噪声增强,以强制学习数据集不变特征。在ASVspoof2019、ADD 2022、FoR和In-The-Wild数据集上进行的大量实验表明,所提出的ADM增强模型在ADD 2022(F1得分0.230)、FoR(F1得分0.604)和In-The-Wild(F1得分0.813)上均实现了优于基线模型的持续优势。动态频率置换在各种条件下被证明是最有效的策略。这些发现强调了基于痕迹的学习在缓解隐式身份泄露方面对于实现更通用的音频深度伪造检测具有重要价值。

关键词

引用

@article{arxiv.2505.06766,
  title  = {Beyond Identity: A Generalizable Approach for Deepfake Audio Detection},
  author = {Yasaman Ahmadiadli and Xiao-Ping Zhang and Naimul Khan},
  journal= {arXiv preprint arXiv:2505.06766},
  year   = {2025}
}

备注

Submitted to IEEE Transactions on Biometrics, Behavior, and Identity Science (T-BIOM)