一种攻击无关的对抗样本检测统计方法
机器学习
2019-11-25 v1 机器学习
摘要
基于深度学习的人工智能系统在视觉、音频、自主系统(车辆、无人机)等多个领域展现出巨大前景。近期关于神经网络的研究表明深度网络易受对抗攻击——一种向输入添加微小扰动以欺骗深度网络使其误分类的技术。开发针对此类对抗攻击的防御是一个活跃的研究领域,一些方法提出对此类对手免疫的鲁棒模型,而其他技术试图检测此类对抗输入。在本文中,我们提出一种用于图像分类中对抗检测的新颖统计方法。我们的方法基于构建每类特征分布,并通过将测试图像的特征与其类别的特征分布进行比较来检测对手。为此,我们利用各种统计距离如ED(能量距离)、MMD(最大均值差异)进行对抗检测,并分析每个度量的性能。我们通过实验表明,我们的方法在MNIST和CIFAR-10数据集上无论攻击方法、样本大小和对抗扰动程度如何都取得了良好的对抗检测性能。
引用
@article{arxiv.1911.10008,
title = {Attack Agnostic Statistical Method for Adversarial Detection},
author = {Sambuddha Saha and Aashish Kumar and Pratyush Sahay and George Jose and Srinivas Kruthiventi and Harikrishna Muralidhara},
journal= {arXiv preprint arXiv:1911.10008},
year = {2019}
}