特征滤波:通过滤除隐性特征检测对抗样本
机器学习
2021-11-30 v2
摘要
深度神经网络(DNNs)正受到对抗样本攻击的威胁。攻击者可通过向输入添加微小精心设计的扰动轻易改变DNNs的输出。对抗样本检测是基于鲁棒DNNs服务的基础性工作。对抗样本揭示了人类与DNNs在图像识别上的差异。从以人为中心的视角,图像特征可分为人类可理解的主导特征,以及人类不可理解却能被DNNs利用的隐性特征。本文揭示,不可感知的对抗样本是隐性特征误导神经网络的产物,且对抗攻击本质上是一种在图像中丰富这些隐性特征的方法。对抗样本的不可感知性表明扰动丰富了隐性特征,却几乎不影响主导特征。因此,对抗样本对滤除隐性特征敏感,而良性样本对此操作免疫。受此启发,我们提出一种仅依赖标签的对抗检测方法,称为特征滤波(feature-filter)。特征滤波利用离散余弦变换近似地将隐性特征与主导特征分离,得到滤除隐性特征的变异图像。仅通过比较DNN对输入及其变异体的预测标签,特征滤波即可实时以高准确率和低误报检测不可感知对抗样本。
引用
@article{arxiv.2107.09502,
title = {Feature-Filter: Detecting Adversarial Examples through Filtering off Recessive Features},
author = {Hui Liu and Bo Zhao and Minzhi Ji and Yuefeng Peng and Jiabao Guo and Peng Liu},
journal= {arXiv preprint arXiv:2107.09502},
year = {2021}
}