中文

当前检测器能否捕捉面部到语音深度伪造攻击?

密码学与安全 2025-11-14 v2 机器学习 多媒体 声音

摘要

生成模型的快速发展使合成语音(音频深度伪造)的制造能力日益增强。近期技术 FOICE 能从单张面部图像生成受害者语音,无需任何语音样本。通过利用面部与声纹特征之间的关联,FOICE 生成的合成语音足以通过行业标准的身份验证系统,如微信语音印章和 Microsoft Azure。这引发严重安全隐患,因为面部图像比语音样本更易获取,大幅降低了大规模攻击的门槛。本文研究两个核心问题:(RQ1)当前最先进的音频深度伪造检测器能否在干净和噪声条件下可靠检测 FOICE 生成的语音;(RQ2)对 FOICE 数据进行针对性微调后,是否能在不过拟合的情况下提高检测效果,同时保持对未见声音生成器(如 SpeechT5)的鲁棒性。我们的研究包含三个贡献:第一,首次系统评估 FOICE 检测,发现领先检测器在标准和噪声条件下均严重失效;第二,引入针对性微调策略,捕捉 FOICE 特定痕迹,显著提升检测准确率;第三,评估微调后的泛化性能,揭示针对 FOICE 的专业化与对未见合成管道鲁棒性之间的权衡。这些发现暴露了当今防御的根本性弱点,催化新一代音频深度伪造检测的新型架构和训练协议的研发。

关键词

引用

@article{arxiv.2510.21004,
  title  = {Can Current Detectors Catch Face-to-Voice Deepfake Attacks?},
  author = {Nguyen Linh Bao Nguyen and Alsharif Abuadbba and Kristen Moore and Tingmin Wu},
  journal= {arXiv preprint arXiv:2510.21004},
  year   = {2025}
}

备注

8 pages, Accepted at Workshop on AI for Cyber Threat Intelligence, co-located with ACSAC 2025