面向噪声感知音频深度伪造检测:综述、SNR基准与实用方案
声音
2025-12-17 v1 人工智能
摘要
深度伪造音频检测借助强大的预训练编码器(如 WavLM、Wav2Vec2、MMS)取得了快速进展。然而,在真实采集条件下——背景噪声(家庭/办公室/交通)、房间混响和消费级信道——性能往往落后于干净实验室结果。我们综述并评估了最先进的音频深度伪造检测模型的鲁棒性,并提出了一种可复现的框架,将 MS-SNSD 噪声与 ASVspoof 2021 DF 语音混合,在受控信噪比(SNR)条件下进行评估。SNR 是语音领域广泛使用的噪声严重程度测量代理指标,使我们能够从近干净(35 dB)到极嘈杂(-5 dB)量化渐进退化。我们研究了预训练编码器(WavLM、Wav2Vec2、MMS)的多条件训练和固定 SNR 测试,在二分类和四分类(真实性×失真)任务上报告了准确率、ROC-AUC 和 EER。在我们的实验中,微调在 10–0 dB SNR 范围内将各骨干网络的 EER 降低了 10–15 个百分点。
引用
@article{arxiv.2512.13744,
title = {Toward Noise-Aware Audio Deepfake Detection: Survey, SNR-Benchmarks, and Practical Recipes},
author = {Udayon Sen and Alka Luqman and Anupam Chattopadhyay},
journal= {arXiv preprint arXiv:2512.13744},
year = {2025}
}
备注
6 pages