基于概率雅可比的显著性图攻击
计算机视觉与模式识别
2020-12-11 v4 密码学与安全
机器学习
摘要
已知神经网络分类器(NNC)容易受到恶意的对抗性输入扰动的影响,包括那些修改一小部分输入特征的扰动,即稀疏攻击或 攻击。有效且快速的 攻击,例如广泛使用的基于雅可比的显著性图攻击(JSMA),不仅在实际中可用于欺骗 NNC,也可用于提高其鲁棒性。在本文中,我们表明,通过 NNC 的输出概率和输入特征对 JSMA 的显著性图进行惩罚,可以获得更强大的攻击算法,该算法能更好地考虑每个输入的特征。这促使我们引入了 JSMA 的改进版本,分别命名为加权 JSMA(WJSMA)和泰勒 JSMA(TJSMA),并通过在三个不同数据集(MNIST、CIFAR-10 和 GTSRB)上的各种白盒和黑盒实验证明,它们都比原始的定向和非定向 JSMA 版本显著更快、更高效。实验还表明,在某些情况下,与 Carlini-Wagner (CW) 攻击相比,我们的攻击取得了极具竞争力的结果,同时像 JSMA 一样保持显著更快的速度(在 CIFAR-10 上,WJSMA 和 TJSMA 比 CW 快 50 倍以上)。因此,对于在诸如前述数据集上的 实时对抗性测试,我们的新攻击在 JSMA 和 CW 之间提供了良好的权衡。代码可通过链接 https://github.com/probabilistic-jsmas/probabilistic-jsmas 公开获取。
引用
@article{arxiv.2007.06032,
title = {Probabilistic Jacobian-based Saliency Maps Attacks},
author = {Théo Combey and António Loison and Maxime Faucher and Hatem Hajri},
journal= {arXiv preprint arXiv:2007.06032},
year = {2020}
}
备注
Journal Machine Learning and Knowledge Extraction