对抗图像中的空间相关模式
人工智能
2020-11-24 v1
摘要
对抗攻击已被证明是朝向可靠机器学习方案研究进展的主要障碍。精心构造的、人眼难以察觉的扰动可被加到图像上,以迫使原本高性能的神经网络误分类。为更好地理解此类结构化攻击的关键成因,我们搜寻并研究了输入空间中像素分布里空间共置的模式。在本文中,我们提出一个框架,用于分隔并隔离输入图像中对分类(推理期间)、对抗脆弱性 or 两者兼有的关键区域。我们断言在推理期间,训练好的模型关注图像中特定区域,我们称之为重要区域(RoI);而攻击者关注用于改变/修改的区域,我们称之为攻击区域(RoA)。该方法的成功也可用于设计一种事后对抗防御方法,正如我们的观察所例示。其利用屏蔽(我们称为中和)图像中那一对对抗攻击高度脆弱但对分类任务不重要的区域的概念。我们建立了形式化分隔、隔离与中和过程的数学框架,并通过标准基准数据集上的实证分析加以证实。研究结果强烈表明,将特征映射回输入空间保留了在特征空间中典型观察到的显著模式,同时增加了主要的可解释性,从而简化了潜在的防御机制。
引用
@article{arxiv.2011.10794,
title = {Spatially Correlated Patterns in Adversarial Images},
author = {Nandish Chattopadhyay and Lionell Yip En Zhi and Bryan Tan Bing Xing and Anupam Chattopadhyay},
journal= {arXiv preprint arXiv:2011.10794},
year = {2020}
}
备注
Submitted for review