中文

通过内省检测神经网络中的对抗样本与其他误分类

机器学习 2019-05-23 v1 密码学与安全 机器学习

摘要

尽管现代神经网络在广泛任务上表现优异,却无法提供可靠的置信度值以检测误分类。这一局限正是所谓对抗样本的核心:网络对稍加修改的图像给出错误预测且伴随高置信度。此外,这种过度自信问题在常规错误和分布外数据中也有观测。我们通过所谓内省来解决此问题,即利用已预训练神经网络 logits 提供的信息。我们展示通过在 logit 激活之上训练一个简单的 3 层神经网络,能够以具有竞争力的水平检测误分类。

关键词

引用

@article{arxiv.1905.09186,
  title  = {Detecting Adversarial Examples and Other Misclassifications in Neural Networks by Introspection},
  author = {Jonathan Aigrain and Marcin Detyniecki},
  journal= {arXiv preprint arXiv:1905.09186},
  year   = {2019}
}

备注

5 pages, 2 figures, Presented at the ICML 2019 Workshop on Uncertainty and Robustness in Deep Learning