GAT:用于对抗样本检测与鲁棒分类的生成对抗训练
机器学习
2022-10-04 v4 密码学与安全
机器学习
摘要
深度神经网络面对对抗样本时的脆弱性,已成为在这些模型部署于敏感领域时的一大重要顾虑。设计一种针对此类攻击的确定性防御被证明颇具挑战,且依赖检测对抗样本的方法仅在攻击者对检测机制不知情时有效。本文提出一种可抵御范数约束白盒攻击的原则性对抗样本检测方法。受一对多分类启发,在一个 K 类分类问题中,我们训练 K 个二分类器,其中第 i 个二分类器用于区分第 i 类的干净数据与其它类的对抗扰动样本。在测试时,我们首先使用训练好的分类器得到输入的预测标签(设为 k),然后使用第 k 个二分类器判定该输入是干净样本(第 k 类)还是对抗扰动样本(其它类)。我们进一步提出一种通过将每个二分类器解释为类条件数据的非归一化密度模型来检测/分类对抗样本的生成式方法。我们针对上述对抗样本检测/分类方法提供了综合评估,并展示了其具有竞争力的性能与引人注目的特性。
引用
@article{arxiv.1905.11475,
title = {GAT: Generative Adversarial Training for Adversarial Example Detection and Robust Classification},
author = {Xuwang Yin and Soheil Kolouri and Gustavo K. Rohde},
journal= {arXiv preprint arXiv:1905.11475},
year = {2022}
}
备注
ICLR 2020, code is available at https://github.com/xuwangyin/GAT-Generative-Adversarial-Training; v4 fixed error in Figure 2