基于类别分数学习检测对抗样本
机器学习
2021-07-12 v1 密码学与安全
计算机视觉与模式识别
摘要
鉴于针对深度神经网络(DNNs)的对抗攻击威胁日益增加,对高效检测方法的研究比以往任何时候都更为重要。本工作中,我们仔细考察了基于已训练分类模型类别分数的对抗攻击检测。我们提出在类别分数上训练支持向量机(SVM)以检测对抗样本。我们的方法能够检测由多种攻击生成的对抗样本,并可轻易用于大量深度分类模型。我们展示了相比已有方法,我们的途径在检测率上有所提升,同时易于实现。我们在不同深度分类模型上进行了广泛的实证分析,考察了各类最先进的对抗攻击。此外,我们观察到所提方法更擅长检测对抗攻击的组合。本工作表明了仅利用已训练分类模型的类别分数来检测多种对抗攻击的潜力。
引用
@article{arxiv.2107.04435,
title = {Learning to Detect Adversarial Examples Based on Class Scores},
author = {Tobias Uelwer and Felix Michels and Oliver De Candido},
journal= {arXiv preprint arXiv:2107.04435},
year = {2021}
}
备注
Accepted at the 44th German Conference on Artificial Intelligence (KI 2021)