基于图方法与特定分布距离的对抗攻击检测
机器学习
2023-10-11 v2 密码学与安全
计算机视觉与模式识别
摘要
人工神经网络容易被经过精心扰动 inputs 所欺骗,从而导致严重的错误分类。这些对抗(adversarial)攻击一直是广泛研究的焦点。同样,关于检测和防御它们的研究方法也层出不穷。我们引入了一种从图视角进行对抗攻击检测与解释的崭新方法。对于输入图像,我们使用层间相关性传播算法 \cite{bach15} 计算其关联的稀疏图。具体而言,我们仅保留具有最高相关性值的神经网络边。然后从该图中计算三个量,并将其与从训练集计算出的相应量进行比较。比较的结果是将图像分类为良性或对抗性。为进行比较,我们引入了两种分类方法:1) 基于应用于节点度的 Wasserstein 距离的显式公式;2) 逻辑回归。两种分类方法均产生了强劲的结果,使我们相信对抗攻击的基于图的解释是有价值的。
引用
@article{arxiv.2306.00042,
title = {Graph-based methods coupled with specific distributional distances for adversarial attack detection},
author = {Dwight Nwaigwe and Lucrezia Carboni and Martial Mermillod and Sophie Achard and Michel Dojat},
journal= {arXiv preprint arXiv:2306.00042},
year = {2023}
}
备注
published in Neural Networks