通过内省检测神经网络中的对抗样本与其他误分类
机器学习
2019-05-23 v1 密码学与安全
机器学习
摘要
尽管现代神经网络在广泛任务上表现优异,却无法提供可靠的置信度值以检测误分类。这一局限正是所谓对抗样本的核心:网络对稍加修改的图像给出错误预测且伴随高置信度。此外,这种过度自信问题在常规错误和分布外数据中也有观测。我们通过所谓内省来解决此问题,即利用已预训练神经网络 logits 提供的信息。我们展示通过在 logit 激活之上训练一个简单的 3 层神经网络,能够以具有竞争力的水平检测误分类。
引用
@article{arxiv.1905.09186,
title = {Detecting Adversarial Examples and Other Misclassifications in Neural Networks by Introspection},
author = {Jonathan Aigrain and Marcin Detyniecki},
journal= {arXiv preprint arXiv:1905.09186},
year = {2019}
}
备注
5 pages, 2 figures, Presented at the ICML 2019 Workshop on Uncertainty and Robustness in Deep Learning