BlurNet:通过滤波特征图进行防御
机器学习
2020-05-19 v2 机器学习
摘要
近来,对抗机器学习领域备受关注,其表明 SOTA 深度神经网络易受对抗样本的影响,这源于向输入图像添加微小扰动。对抗样本由恶意攻击者通过获取模型参数(如梯度信息)以修改输入,或通过攻击替代模型并将这些恶意样本迁移过来以攻击受害模型而生成。具体而言,其中一种攻击算法 Robust Physical Perturbations()生成带有黑白贴纸的停车标志对抗图像,以针对标准架构的交通标志分类器实现高目标误分类率。本文中,我们提出 BlurNet,一种针对 攻击的防御方法。首先,我们通过 LISA 数据集上网络第一层特征图的频率分析来论证该防御的动机,分析表明 算法向输入图像中引入了高频噪声。为去除高频噪声,我们在第一层之后引入一个由标准模糊核组成的深度可分离卷积层。我们执行黑盒迁移攻击以表明对特征图进行低通滤波比滤波输入更有利。然后,我们提出多种正则化方案将该低通滤波行为纳入网络的训练机制,并执行白盒攻击。最后我们通过自适应攻击评估表明,采用所提防御之一的总变分正则化后,攻击成功率从 90% 降至 20%。
引用
@article{arxiv.1908.02256,
title = {BlurNet: Defense by Filtering the Feature Maps},
author = {Ravi Raju and Mikko Lipasti},
journal= {arXiv preprint arXiv:1908.02256},
year = {2020}
}
备注
10 pages, 4 figures, Accepted at DSN 2020 workshop: Dependable and Secure Machine Learning