并非所有对抗样本都需要复杂防御:基于四分位距对数阈值识别过度优化的对抗样本
机器学习
2019-07-31 v1 密码学与安全
计算机视觉与模式识别
机器学习
摘要
检测对抗样本目前是深度学习领域最大的挑战之一。产生对抗样本的对抗攻击,会提高特定数据点目标类的预测似然。在此过程中,即使对抗样本已被以 100% 置信度错误分类,仍可进一步被优化,从而使对抗样本更难以检测。对于这类我们称之为过度优化对抗样本的对抗样本,我们发现模型的对数(logits)为判断手头数据点是对抗的还是真实的提供了可靠线索。在此背景下,我们首先讨论了 softmax 函数对预测结果的掩蔽效应,并解释为何模型的对数在检测过度优化对抗样本时更有用。为在实践中识别此类对抗样本,我们提出了一种非参数且计算高效的方法,其依赖于四分位距(interquartile range),且该方法随图像分辨率增大而更有效。我们通过针对不同数据集(MNIST、CIFAR-10 和 ImageNet)和多种架构的详细实验支撑了全文的观察。
引用
@article{arxiv.1907.12744,
title = {Not All Adversarial Examples Require a Complex Defense: Identifying Over-optimized Adversarial Examples with IQR-based Logit Thresholding},
author = {Utku Ozbulak and Arnout Van Messem and Wesley De Neve},
journal= {arXiv preprint arXiv:1907.12744},
year = {2019}
}
备注
Accepted for the 2019 International Joint Conference on Neural Networks (IJCNN-19)