中文

概念基准遮罩:针对对抗性贴纸攻击的无贴纸位置依赖防御

计算机视觉与模式识别 2025-10-07 v1 人工智能

摘要

对抗性贴纸攻击通过局部扰动强制模型进行目标错误分类,构成深度学习模型的实际威胁。现有防御方法通常假设贴纸的尺寸或位置先验知识,限制了其适用性。本文提出一种无贴纸位置依赖的防御方法,利用概念基准解释识别并抑制最具影响力的概念激活向量,从而在不显式检测的情况下中和贴纸效应。在以 ResNet-50 为基础的 Imagenette 数据集上进行评估,本方法相较于最先进的 PatchCleanser 获得更高的鲁棒性和干净准确率,同时在不同贴纸尺寸和位置下保持良好性能。我们的结果表明,结合可解释性与鲁棒性的策略具有潜在应用前景,建议概念驱动的防御方法可为对抗性贴纸攻击提供可扩展的安全策略。

关键词

引用

@article{arxiv.2510.04245,
  title  = {Concept-Based Masking: A Patch-Agnostic Defense Against Adversarial Patch Attacks},
  author = {Ayushi Mehrotra and Derek Peng and Dipkamal Bhusal and Nidhi Rastogi},
  journal= {arXiv preprint arXiv:2510.04245},
  year   = {2025}
}

备注

neurips workshop