训练集成模型以检测对抗样本
机器学习
2017-12-13 v1 密码学与安全
计算机视觉与模式识别
摘要
我们提出一种新的集成方法,用于检测和分类由最先进攻击(包括DeepFool和C&W)生成的对抗样本。我们的方法通过训练集成中的成员在随机良性样本上保持低分类误差,同时最小化训练分布外样本上的一致性来工作。我们在MNIST和CIFAR-10上针对不知情对手以及白盒和黑盒对手进行了评估。
引用
@article{arxiv.1712.04006,
title = {Training Ensembles to Detect Adversarial Examples},
author = {Alexander Bagnall and Razvan Bunescu and Gordon Stewart},
journal= {arXiv preprint arXiv:1712.04006},
year = {2017}
}