音频深度伪造检测器的鲁棒性测量
密码学与安全
2025-03-25 v1 人工智能
声音
摘要
深度伪造技术已成为生成式AI在图像、音频和视频等各类媒介中日益普及且加剧的顾虑。在这些媒介中,音频深度伪造尤其引人担忧,因为高质量语音合成技术易于通过社交媒体和机器人电话等平台进行分发。因此,检测音频深度伪造在遏制AI合成语音的滥用方面发挥着关键作用。然而,现实场景常常会引入各种音频损坏,如噪声、修改和压缩,可能显著影响检测性能。本工作系统评估了10种音频深度伪造检测模型对16种常见损坏的鲁棒性,这些损坏被分为噪声扰动、音频修改和压缩三类。我们使用传统深度学习模型和最新的基础模型,提出了四个独特发现。首先,我们发现虽然大多数模型对噪声表现出强鲁棒性,但对修改和压缩(尤其是当施加神经编码器时)则极其脆弱。其次,语音基础模型在大多数情境下均优于传统模型,这可能是由于其自监督学习范式和大规模预训练所致。其次,我们的结果显示,增加模型规模可提升鲁棒性,但收益有递减。第四,我们展示了通过针对性数据增强进行训练可增强模型对未见扰动的韧性。针对政治演讲深度伪造的案例研究表明,基础模型在现实条件下能够实现高准确率。这一发现突显了开发更鲁棒的检测框架的重要性,以确保在实际部署环境中的可靠性。
引用
@article{arxiv.2503.17577,
title = {Measuring the Robustness of Audio Deepfake Detectors},
author = {Xiang Li and Pin-Yu Chen and Wenqi Wei},
journal= {arXiv preprint arXiv:2503.17577},
year = {2025}
}