对抗图像中的两个灵魂:基于多视图不一致性的通用对抗样本检测
计算机视觉与模式识别
2021-10-12 v2
摘要
在针对深度神经网络(DNN)的规避攻击中,攻击者生成与良性样本视觉上无法区分的对抗实例,并将其发送至目标DNN以触发误分类。在本文中,我们基于一种新颖观察提出一种新颖的多视图对抗图像检测器,即Argos。即,一个对抗实例中存在两个“灵魂”,即对应真实标签的视觉未变内容,以及对应误分类标签的所添加不可见扰动。此类不一致性可进一步通过自回归生成方法被放大,该方法使用从原图像中选取的种子像素、所选标签以及从训练数据中学习到的像素分布来生成图像。若标签为对抗性的,所生成的图像(即“视图”)将显著偏离原图像,展现出Argos预期检测的不一致性。为此,Argos首先利用一组再生机制放大攻击引起的图像视觉内容与其误分类标签之间的偏差,然后若再现视图偏离至预设程度,则将图像识别为对抗性的。我们的实验结果表明,在检测准确率和针对六种知名对抗攻击的鲁棒性上,Argos均显著优于两种代表性对抗检测器。代码可见于:https://github.com/sohaib730/Argos-Adversarial_Detection
引用
@article{arxiv.2109.12459,
title = {Two Souls in an Adversarial Image: Towards Universal Adversarial Example Detection using Multi-view Inconsistency},
author = {Sohaib Kiani and Sana Awan and Chao Lan and Fengjun Li and Bo Luo},
journal= {arXiv preprint arXiv:2109.12459},
year = {2021}
}