中文

Jujutsu:一种针对深度神经网络对抗补丁攻击的两阶段防御方法

密码学与安全 2022-12-19 v4 人工智能 机器学习

摘要

对抗补丁攻击通过在输入的有限区域内注入任意扰动来制造对抗样本以欺骗深度神经网络(DNNs)。这些攻击具有鲁棒性(即可物理实现)且普遍恶意,因此对现实世界中基于 DNN 的系统构成严重安全威胁。我们提出 Jujutsu,一种用于检测并缓解鲁棒且通用的对抗补丁攻击的两阶段技术。我们首先观察到,对抗补丁被构造为局部特征,对预测输出产生巨大影响,并在任意输入上持续主导预测。Jujutsu 利用该观察以低误报率进行准确攻击检测。补丁攻击仅破坏输入的局部区域,而输入的大部分保持未被扰动。因此,Jujutsu 利用生成对抗网络(GAN)通过合成被攻击破坏的输入语义内容来执行局部攻击恢复,并重建“干净”输入以正确预测。我们在涵盖 8 种不同 DNN 模型的四个多样数据集上评估 Jujutsu,发现其性能优越并显著超越四种现有防御。我们进一步针对物理世界攻击以及自适应攻击评估了 Jujutsu。

关键词

引用

@article{arxiv.2108.05075,
  title  = {Jujutsu: A Two-stage Defense against Adversarial Patch Attacks on Deep Neural Networks},
  author = {Zitao Chen and Pritam Dash and Karthik Pattabiraman},
  journal= {arXiv preprint arXiv:2108.05075},
  year   = {2022}
}

备注

To appear in AsiaCCS'23