对抗攻击的剖析:基于概念的可解释人工智能解剖
机器学习
2024-03-26 v1 人工智能
计算机视觉与模式识别
摘要
对抗攻击 对深度神经网络的可靠性与鲁棒性构成重大威胁。尽管这些攻击对模型预测的影响已被广泛研究,但它们对这些模型中学习到的表示与概念的影响在很大程度上仍未被探索。在本工作中,我们利用可解释人工智能 (XAI) 技术,对 AAs 影响卷积神经网络 学习概念的情况进行了深入分析。通过在各种网络架构和目标 AA 技术上进行大量实验,我们揭示了若干关键发现。首先,AAs 会在特征空间内的概念构成中引发实质性改变,引入新概念或修改现有概念。其次,对抗扰动本身可线性分解为一组潜在向量分量,其中一个子集对攻击的成功起关键作用。值得注意的是,我们发现这些分量是特定于目标的,即对于给定的目标类,在不同的 AA 技术和起始类中它们是相似的。我们的发现为 AAs 的本质及其对学习表示的影响提供了有价值的见解,为开发更鲁棒、更可解释的深度学习模型以及有效的对抗威胁防御手段铺平了道路。
引用
@article{arxiv.2403.16782,
title = {The Anatomy of Adversarial Attacks: Concept-based XAI Dissection},
author = {Georgii Mikriukov and Gesina Schwalbe and Franz Motzkus and Korinna Bade},
journal= {arXiv preprint arXiv:2403.16782},
year = {2024}
}