特征压缩:检测深度神经网络中的对抗样本
计算机视觉与模式识别
2017-12-07 v2 密码学与安全
机器学习
摘要
尽管深度神经网络(DNNs)在许多任务中取得了巨大成功,但它们常常被对抗样本所欺骗,这些样本是通过在自然样本中添加微小但有目的的扰动生成的。以往防御对抗样本的研究主要集中在改进 DNN 模型上,但要么成效有限,要么需要昂贵的计算。我们提出了一种新策略,特征压缩,可用于通过检测对抗样本来加固 DNN 模型。特征压缩通过将原始空间中对应许多不同特征向量的样本合并为单个样本,从而减少对手可用的搜索空间。通过比较 DNN 模型对原始输入与压缩输入的预测,特征压缩能够高精度且低误报率地检测对抗样本。本文探索了两种特征压缩方法:降低每个像素的颜色位深度与空间平滑。这些简单策略成本低廉,与其他防御方法互补,并且可以在联合检测框架中结合,以实现对最先进攻击的高检测率。
引用
@article{arxiv.1704.01155,
title = {Feature Squeezing: Detecting Adversarial Examples in Deep Neural Networks},
author = {Weilin Xu and David Evans and Yanjun Qi},
journal= {arXiv preprint arXiv:1704.01155},
year = {2017}
}
备注
To appear in Network and Distributed Systems Security Symposium (NDSS) 2018