中文

CLAD:基于对比学习的鲁棒音频深度伪造检测

密码学与安全 2024-04-25 v1 机器学习 声音 音频与语音处理

摘要

音频深度伪造的日益普及构成重大的安全威胁,亟需具鲁棒性的检测方法。虽然现有检测系统显示出前景,但其对恶意音频操作的鲁棒性仍未得到充分探讨。为填补这一空白,本文首次对最广泛采用的音频深度伪造检测器易受操控攻击的脆弱性进行全面研究。意外地,即使是诸如音量控制等简单操作,也能显著规避检测,而不影响人类感知。为此,我们提出了 CLAD(Contrastive Learning-based Audio deepfake Detector),以增强其对操控攻击的鲁棒性。其核心思想是采用对比学习以最小化操控引入的变异,从而提升检测鲁棒性。此外,我们引入长度损失,以在特征空间中更紧密地聚类真实音频,提高检测准确性。我们全面评估了最广泛采用的音频深度伪造检测模型以及我们提出的 CLAD 对各种操控攻击的表现。检测模型存在脆弱性,在音量控制、淡入和噪声注入下,分别导致的误报率(FAR)分别升至 36.69%、31.23% 和 51.28%。CLAD 在噪声注入下将 FAR 降至 0.81%,并在所有测试中始终将 FAR 保持在 1.63% 以下。我们的源代码和文档均可在工件仓库(https://github.com/CLAD23/CLAD)中获取。

关键词

引用

@article{arxiv.2404.15854,
  title  = {CLAD: Robust Audio Deepfake Detection Against Manipulation Attacks with Contrastive Learning},
  author = {Haolin Wu and Jing Chen and Ruiying Du and Cong Wu and Kun He and Xingcan Shang and Hao Ren and Guowen Xu},
  journal= {arXiv preprint arXiv:2404.15854},
  year   = {2024}
}

备注

Submitted to IEEE TDSC