中文

异常揭晓:保障图像分类免受对抗补丁攻击

计算机视觉与模式识别 2024-02-12 v1 密码学与安全

摘要

对抗补丁攻击对深度学习系统的实际部署构成了重大威胁。然而,现有的研究主要集中在图像预处理防御上,这通常会降低干净图像的分类准确率,并且无法有效抵御物理上可行的攻击。在本文中,我们研究了对抗补丁作为图像信息分布中异常的行为,并利用这一见解开发了一种鲁棒的防御策略。我们提出的防御机制利用一种称为 DBSCAN 的基于聚类的技术来隔离异常图像片段,该机制通过由分割、隔离和阻断三个阶段组成的流水线来识别和减轻对抗噪声。在识别出对抗成分后,我们通过将其替换为平均像素值来中和它们,这超越了其他替换选项。我们的模型无关防御机制在多个模型和数据集上进行了评估,证明了其在图像分类任务中抵御各种对抗补丁攻击的有效性。我们提出的方法显著提高了准确率,在抵御 LaVAN 和 GoogleAp 攻击时,从无防御时的 38.8% 提升至有防御时的 67.1%,超越了 LGS (53.86%) 和 Jujutsu (60%) 等著名的 SOTA 方法。

关键词

引用

@article{arxiv.2402.06249,
  title  = {Anomaly Unveiled: Securing Image Classification against Adversarial Patch Attacks},
  author = {Nandish Chattopadhyay and Amira Guesmi and Muhammad Shafique},
  journal= {arXiv preprint arXiv:2402.06249},
  year   = {2024}
}