中文

DefensiveDR:利用降维防御对抗对抗补丁

密码学与安全 2023-11-22 v1

摘要

基于对抗补丁的攻击已被证明是可靠使用机器学习模型的一大阻碍。这些攻击涉及策略性修改局部补丁或特定图像区域以欺骗训练好的机器学习模型。本文中,我们提出DefensiveDR,一种使用降维技术阻止此类补丁攻击的实用机制。我们的方法将样本图像投影到较低维空间,同时保留用于有效机器学习任务的基本信息或变异性。我们使用奇异值分解和t分布随机邻域嵌入两种技术实现这一点。我们将保留的变异性作为超参数进行实验调优以获得最优性能。该降维显著减轻了对抗扰动,从而增强了给定机器学习模型的鲁棒性。我们的防御与模型无关,且不对模型决策或模型架构的访问作假设,使其在黑盒和白盒设置下均有效。此外,它在各种模型上保持准确率,并对几种未见过的基于补丁的攻击保持鲁棒。所提出的防御方法在遭受LaVAN和GoogleAp攻击时,将准确率从38.8%(无防御)提升至66.2%(有防御),优于突出的SOTA方法如LGS(53.86%)和Jujutsu(60%)。

关键词

引用

@article{arxiv.2311.12211,
  title  = {DefensiveDR: Defending against Adversarial Patches using Dimensionality Reduction},
  author = {Nandish Chattopadhyay and Amira Guesmi and Muhammad Abdullah Hanif and Bassem Ouni and Muhammad Shafique},
  journal= {arXiv preprint arXiv:2311.12211},
  year   = {2023}
}