基于类条件生成对抗网络的对抗样本异常检测
机器学习
2022-05-13 v2 图像与视频处理
摘要
深度神经网络 (DNNs) 已被证明易受测试时规避攻击 (TTEs,或称对抗样本) 的威胁,此类攻击通过对输入做微小改动来改变 DNN 的决策。我们提出了一种基于类条件生成对抗网络 (GANs) 的 DNN 分类器无监督攻击检测器。我们通过辅助分类器 GAN (AC-GAN) 对以预测类标签为条件的干净数据分布建模。给定测试样本及其预测类别,基于 AC-GAN 生成器与判别器计算三种检测统计量。在多种 TTE 攻击下的图像分类数据集实验表明,我们的方法优于以往的检测方法。我们还考察了使用不同 DNN 层 (输入特征或内部层特征) 进行异常检测的有效性,并正如预期所示,使用更靠近 DNN 输出层的特征时异常更难检测。
引用
@article{arxiv.2105.10101,
title = {Anomaly Detection of Adversarial Examples using Class-conditional Generative Adversarial Networks},
author = {Hang Wang and David J. Miller and George Kesidis},
journal= {arXiv preprint arXiv:2105.10101},
year = {2022}
}