面向深度神经网络对抗防御的显著特征提取器
计算机视觉与模式识别
2021-05-17 v1 人工智能
密码学与安全
摘要
近年来,深度学习模型在计算机视觉领域取得了前所未有的成功。然而,它们对精心构造的对抗样本所表现出的脆弱性也日益引起研究人员的关注。基于对抗样本源于模型从原始数据集中学到的非鲁棒特征的观察,我们提出了显著特征(SF)与琐碎特征(TF)的概念。前者代表与类别相关的特征,而后者通常用于误导模型。我们利用耦合生成对抗网络模型提取这两类特征,并提出一种名为显著特征提取器(SFE)的新型检测与防御方法来抵御对抗攻击。具体而言,检测通过分离并比较输入中 SF 与 TF 的差异来实现。同时,通过对 SF 重新识别获得正确标签,从而达到防御目的。我们在 MNIST、CIFAR-10 和 ImageNet 数据集上进行了大量实验,结果表明与基线方法相比,SFE 在有效性与效率上均取得了 SOTA 结果。此外,我们对该防御与检测过程提供了可解释的理解。
引用
@article{arxiv.2105.06807,
title = {Salient Feature Extractor for Adversarial Defense on Deep Neural Networks},
author = {Jinyin Chen and Ruoxi Chen and Haibin Zheng and Zhaoyan Ming and Wenrong Jiang and Chen Cui},
journal= {arXiv preprint arXiv:2105.06807},
year = {2021}
}