SpaNN: 通过跨越敏感性阈值检测CNN上的多个对抗性补丁
计算机视觉与模式识别
2025-06-25 v1 机器学习
摘要
面向对象检测和图像分类的领先卷积神经网络模型对可物理实现的对抗性扰动(如补丁攻击)高度脆弱。现有防御措施主要关注单补丁攻击,要么未充分探讨其对补丁数量的敏感性,要么在最坏情况下计算上不可行或效率低下。本文提出了SpaNN,一种补丁数量与计算复杂度无关的攻击检测器。该检测器的关键新颖之处在于,通过对 victim 模型第一个卷积层的神经激活应用一组敏感性阈值,构建一组二值化特征图。随后对该组合进行聚类,并将聚类特征作为分类器输入用于攻击检测。与现有检测器不同,SpaNN不依赖固定的敏感性阈值来识别对抗性区域,因此对白盒对抗攻击具有鲁棒性。我们在四个广泛用于对象检测和分类的数据集上评估了SpaNN,结果表明该方法在对象检测和图像分类分别在最先进防御措施上提升了最高可达11个和27个百分点。我们的代码已公开于https://github.com/gerkbyrd/SpaNN。
引用
@article{arxiv.2506.18591,
title = {SpaNN: Detecting Multiple Adversarial Patches on CNNs by Spanning Saliency Thresholds},
author = {Mauricio Byrd Victorica and György Dán and Henrik Sandberg},
journal= {arXiv preprint arXiv:2506.18591},
year = {2025}
}
备注
2025 IEEE Conference on Secure and Trustworthy Machine Learning (SaTML2025)