中文

一种攻击无关的对抗样本检测统计方法

机器学习 2019-11-25 v1 机器学习

摘要

基于深度学习的人工智能系统在视觉、音频、自主系统(车辆、无人机)等多个领域展现出巨大前景。近期关于神经网络的研究表明深度网络易受对抗攻击——一种向输入添加微小扰动以欺骗深度网络使其误分类的技术。开发针对此类对抗攻击的防御是一个活跃的研究领域,一些方法提出对此类对手免疫的鲁棒模型,而其他技术试图检测此类对抗输入。在本文中,我们提出一种用于图像分类中对抗检测的新颖统计方法。我们的方法基于构建每类特征分布,并通过将测试图像的特征与其类别的特征分布进行比较来检测对手。为此,我们利用各种统计距离如ED(能量距离)、MMD(最大均值差异)进行对抗检测,并分析每个度量的性能。我们通过实验表明,我们的方法在MNIST和CIFAR-10数据集上无论攻击方法、样本大小和对抗扰动程度如何都取得了良好的对抗检测性能。

关键词

引用

@article{arxiv.1911.10008,
  title  = {Attack Agnostic Statistical Method for Adversarial Detection},
  author = {Sambuddha Saha and Aashish Kumar and Pratyush Sahay and George Jose and Srinivas Kruthiventi and Harikrishna Muralidhara},
  journal= {arXiv preprint arXiv:1911.10008},
  year   = {2019}
}