无模型信息的对抗检测
计算机视觉与模式识别
2022-04-06 v2
摘要
先前最先进的对抗检测工作依赖于分类器模型,即它们需要分类器模型的输出和参数来训练检测器或进行对抗检测。这使其检测方法特定于分类器模型。此外,分类器模型的输出和参数未必总可获取。为此,我们提出一种独立于分类器模型的对抗检测方法,使用简单的能量函数区分对抗样本与自然输入。我们训练一个独立于分类器模型的独立检测器,采用逐层能量分离(LES)训练来增大自然能量与对抗能量之间的分离度。据此,我们执行基于能量分布的对抗检测。我们的方法在 CIFAR10、CIFAR100 和 TinyImagenet 数据集上,针对广泛的梯度、得分和高斯噪声攻击,取得了与最先进检测工作相当的性能(ROC-AUC > 0.9)。此外,与先前工作相比,我们的检测方法轻量,所需训练数据更少(实际数据集的 40%),且可跨不同数据集迁移。为可复现,我们在 https://github.com/Intelligent-Computing-Lab-Yale/Energy-Separation-Training 提供逐层能量分离训练代码。
引用
@article{arxiv.2202.04271,
title = {Adversarial Detection without Model Information},
author = {Abhishek Moitra and Youngeun Kim and Priyadarshini Panda},
journal= {arXiv preprint arXiv:2202.04271},
year = {2022}
}
备注
This paper has 14 pages of content and 2 pages of references