分类失效处,解释崛起时
机器学习
2017-12-05 v1 机器学习
摘要
深度神经网络一个引人注目的特性是其对对抗性输入固有的脆弱性,这严重阻碍了其在安全关键领域的应用。大多数现有检测方法试图使用精心设计的模式来区分对抗性输入与真实输入,然而这些方法常可被自适应对手规避。在本工作中,我们采取完全不同的路径,利用对抗性输入的定义:虽能欺骗深度神经网络,却几乎无法被人类视觉察觉。基于可解释模型的最新进展,我们构建了一个对比输入的解释与其分类的新检测框架。我们通过使用基准数据集和攻击的大量实验验证了该框架的有效性。我们相信本工作为设计对抗性输入检测方法开辟了新方向。
引用
@article{arxiv.1712.00558,
title = {Where Classification Fails, Interpretation Rises},
author = {Chanh Nguyen and Georgi Georgiev and Yujie Ji and Ting Wang},
journal= {arXiv preprint arXiv:1712.00558},
year = {2017}
}
备注
6 pages, 6 figures