重新审视模型不确定性与置信度用于对抗样本检测
密码学与安全
2021-06-22 v2 计算机视觉与模式识别
机器学习
摘要
依赖深度神经网络(DNNs)的安全敏感应用易受精心构造以生成对抗样本(AEs)的微小扰动攻击。这些对抗样本对人类不可感知,并导致DNN将其误分类。已有许多防御与检测技术被提出。模型的置信度与Dropout作为一种估计模型不确定性的流行方法,已被用于AE检测,但其在黑盒与灰盒攻击下收效有限。此外,最先进的检测技术或为特定攻击设计、或被其他攻击攻破,需要关于攻击的知识,不一致,增加模型参数开销,耗时,或在推理时间上存在延迟。为权衡这些因素,我们重新审视模型的不确定性与置信度,并提出一种新颖的无监督集成AE检测机制:1)使用称为SelectiveNet的不确定性方法,2)处理模型层输出即特征图,以生成新的置信概率。该检测方法称为基于选择性与特征的对付对抗检测(SFAD)。实验结果表明,所提方法在黑盒与灰盒攻击下优于最先进方法,并在白盒攻击下取得可比性能。此外,结果表明SFAD对MNIST上的高置信攻击(HCAs)完全鲁棒,对CIFAR10数据集部分鲁棒。
引用
@article{arxiv.2103.05354,
title = {Revisiting Model's Uncertainty and Confidences for Adversarial Example Detection},
author = {Ahmed Aldahdooh and Wassim Hamidouche and Olivier Déforges},
journal= {arXiv preprint arXiv:2103.05354},
year = {2021}
}
备注
Under review