面向对抗样本鲁棒检测的研究
机器学习
2018-11-08 v4
摘要
尽管近期进展显著,深度学习方法仍可能易受恶意生成的对抗样本攻击。本文提出一种新颖的训练过程和阈值测试策略,以实现对抗样本的鲁棒检测。在训练中,我们提出最小化反向交叉熵(RCE),促使深度网络学习能更好区分对抗样本与正常样本的潜在表示。在测试中,我们提出采用阈值策略作为检测器,滤除对抗样本以实现可靠预测。该方法使用标准算法即可简单实现,与常见的交叉熵最小化相比,额外训练成本极低。我们将该方法应用于广泛使用的MNIST和CIFAR-10数据集上,防御多种攻击方法,并在对抗环境下的所有威胁模型中均取得了鲁棒预测的显著改进。
引用
@article{arxiv.1706.00633,
title = {Towards Robust Detection of Adversarial Examples},
author = {Tianyu Pang and Chao Du and Yinpeng Dong and Jun Zhu},
journal= {arXiv preprint arXiv:1706.00633},
year = {2018}
}