中文

音频深度伪造检测能否泛化?

声音 2026-03-30 v5 机器学习 音频与语音处理

摘要

当前的文本到语音算法能生成逼真的人类语音伪造,使得深度伪造检测成为亟需研究的领域。尽管研究者已提出多种检测音频欺骗的技术,这些架构成功的原因常不清晰:预处理步骤、超参数设置与微调程度在相关工作中并不一致。哪些因素促成了成功,哪些又是偶然?本工作中,我们着手解决该问题:通过重新实现并统一评估相关工作中的架构,使音频欺骗检测系统化。我们识别出成功音频深度伪造检测的总体特征,例如在其它因素不变时使用 cqtspec 或 logspec 特征替代 melspec 特征,平均可降低 37% EER。此外,我们评估了泛化能力:我们收集并发布了一个由 37.9 小时名人政要自然音频录音组成的新数据集,其中 17.2 小时为深度伪造。我们发现相关工作在真实世界数据上表现不佳(性能退化高达一千个百分点)。这可能表明社区将其方案过度贴合主流的 ASVSpoof 基准,且实验室外的深度伪造比此前认为的更难检测。

关键词

引用

@article{arxiv.2203.16263,
  title  = {Does Audio Deepfake Detection Generalize?},
  author = {Nicolas M. Müller and Pavel Czempin and Franziska Dieckmann and Adam Froghyar and Konstantin Böttinger},
  journal= {arXiv preprint arXiv:2203.16263},
  year   = {2026}
}

备注

Interspeech 2022