是否可能利用自然触发器对人脸伪造检测进行后门攻击?
计算机视觉与模式识别
2024-01-02 v1
摘要
深度神经网络显著提高了人脸伪造检测模型在区分人工智能生成内容 (AIGC) 方面的性能。然而,其安全性受到模型训练期间注入触发器(即后门攻击)的严重威胁。虽然现有的后门防御和人工数据选择可以缓解使用人眼敏感触发器(如补丁或对抗噪声)的攻击,但更具挑战性的自然后门触发器仍未得到充分研究。为了进一步研究自然触发器,我们提出了一种针对人脸伪造检测模型的新型分析合成后门攻击方法,该方法在潜在空间中嵌入自然触发器。我们从两个角度彻底研究了这种后门脆弱性:(1) 模型判别(基于优化的触发器):我们采用替代检测模型,并通过最小化交叉熵损失来寻找触发器;(2) 数据分布(自定义触发器):我们操纵长尾分布中不常见的面部属性,以在无需检测模型监督的情况下生成中毒样本。此外,为了全面评估检测模型对最新 AIGC 的性能,我们利用最先进的 StyleGAN 和 Stable Diffusion 进行触发器生成。最后,这些后门触发器为生成的中毒样本引入了特定的语义特征(例如皮肤纹理和微笑),使其更加自然和鲁棒。大量实验表明,我们的方法在三个层面上优于现有方法:(1) 攻击成功率:我们的方法实现了高攻击成功率(超过 99%),且在低投毒率(小于 3%)下仅引起微小的模型精度下降(低于 0.2%);(2) 后门防御:面对现有的后门防御方法时,我们的方法表现出更好的鲁棒性;(3) 人工检查:综合用户研究表明,我们的方法对人眼更不敏感。
引用
@article{arxiv.2401.00414,
title = {Is It Possible to Backdoor Face Forgery Detection with Natural Triggers?},
author = {Xiaoxuan Han and Songlin Yang and Wei Wang and Ziwen He and Jing Dong},
journal= {arXiv preprint arXiv:2401.00414},
year = {2024}
}