中文

从伪影中检测对抗样本

机器学习 2017-11-17 v3 机器学习

摘要

深度神经网络(DNNs)是已知对输入随机扰动鲁棒的强大非线性架构。然而,这些模型易受对抗扰动——显式构造以欺骗模型的小输入改变。本文探讨 DNN 是否能区分对抗样本与其正常和噪声对应物。我们通过查看 dropout 神经网络中可用的贝叶斯不确定性估计,并通过在执行模型所学习的深度特征子空间中的密度估计,来调查对抗样本上的模型置信度。结果是一种对攻击算法不知情的隐式对抗检测方法。我们在包括 MNIST 和 CIFAR-10 的多种标准数据集上评估该方法,并显示它在不同架构和攻击间泛化良好。我们的发现报告称,在若干标准分类任务上可实现 85–93% ROC-AUC,其负类由正常和噪声样本共同组成。

关键词

引用

@article{arxiv.1703.00410,
  title  = {Detecting Adversarial Samples from Artifacts},
  author = {Reuben Feinman and Ryan R. Curtin and Saurabh Shintre and Andrew B. Gardner},
  journal= {arXiv preprint arXiv:1703.00410},
  year   = {2017}
}

备注

Submitted to ICML 2017