中文

基于特征金字塔匹配的语音深度伪造异常检测与定位

声音 2025-03-25 v1 计算机视觉与模式识别 多媒体

摘要

AI 驱动的生成模型的兴起使得能够制作出高度逼真的语音深度伪造——能够模仿目标说话者语音的合成音频信号——成为可能,这引发了 critical 安全顾虑。现有的语音深度伪造检测方法主要依赖监督学习,存在两个 critical 局限:即便对未见的合成技术也难以泛化,以及缺乏可解释性。为此,本文提出一种新颖的可解释单类检测框架,将语音深度伪造检测重新定义为异常检测任务。该模型仅基于真实语音进行训练,以刻画其分布,从而对分布之外的样本进行分类,识别为合成生成。此外,本框架在推理过程中会生成可解释的异常图,突出显示时间与频率域中的异常区域。通过引入 Student-Teacher Feature Pyramid Matching 系统,并增强 Discrepancy Scaling 以提升对未见数据分布的泛化能力,实现了上述目标。广泛的评估表明,我们的方法在考虑的基准方法之上取得了优异性能,验证了将语音深度伪造检测视为异常检测问题的有效性。

关键词

引用

@article{arxiv.2503.18032,
  title  = {Anomaly Detection and Localization for Speech Deepfakes via Feature Pyramid Matching},
  author = {Emma Coletta and Davide Salvi and Viola Negroni and Daniele Ugo Leonzio and Paolo Bestagini},
  journal= {arXiv preprint arXiv:2503.18032},
  year   = {2025}
}