ODDR:基于离群点检测与降维的对抗补丁防御
密码学与安全
2024-08-28 v2 计算机视觉与模式识别
摘要
对抗攻击对机器学习模型的可靠部署构成重大挑战,其中基于补丁的攻击尤为强大。这些攻击在图像的局部区域引入对抗扰动,甚至欺骗训练良好的模型。本文中,我们提出离群点检测与降维(ODDR),一种通过先进统计方法抵御基于补丁的对抗攻击的综合防御策略。我们的方法基于如下观察:对应于对抗补丁(无论是自然还是合成)的输入特征偏离其余图像数据的内在分布,因此可被识别为离群点。ODDR 通过稳健的三阶段流水线运作:分片、隔离与中和。该模型无关框架通用灵活,可针对包括图像分类、目标检测与深度估计在内的多种任务提供保护,并在基于 CNN 与基于 Transformer 的架构中均被证明有效。在分片阶段,图像样本被划分为较小片段,为隔离阶段做准备;隔离阶段使用先进离群点检测技术隔离与对抗扰动相关的异常特征。中和阶段随后对这些离群点应用降维技术,在保留机器学习任务关键信息的同时有效中和对抗影响。在基准数据集上针对最先进对抗补丁的广泛评估凸显了 ODDR 的效能。我们的方法在 GoogleAp 攻击下将模型准确率从 39.26% 提升至 79.1%,优于 LGS(53.86%)、Jujutsu(60%)和 Jedi(64.34%)等领先防御方法。
引用
@article{arxiv.2311.12084,
title = {ODDR: Outlier Detection & Dimension Reduction Based Defense Against Adversarial Patches},
author = {Nandish Chattopadhyay and Amira Guesmi and Muhammad Abdullah Hanif and Bassem Ouni and Muhammad Shafique},
journal= {arXiv preprint arXiv:2311.12084},
year = {2024}
}