中文

通过匹配预测分布进行对抗样本检测与纠正

机器学习 2020-02-24 v1 机器学习

摘要

我们提出一种针对机器学习分类器的新型对抗检测与纠正方法。该检测器由一个自编码器构成,其使用基于原始实例与重构实例上分类器预测之间 Kullback-Leibler 散度的自定义损失函数进行训练。该方法无监督、易于训练,且不需要任何关于底层攻击的知识。该检测器几乎完全中和了 MNIST 与 Fashion-MNIST 上如 Carlini-Wagner 或 SLIDE 的强力攻击,并且在攻击方获得分类模型但非防御的完整访问权限时,在 CIFAR-10 上仍非常有效。我们表明,在攻击方同时完全掌握模型与防御的白盒攻击情形下,我们的方法仍能检测对抗样本,并研究了攻击的鲁棒性。该方法非常灵活,也可用于检测对模型性能产生负面影响的常见数据损坏与扰动。我们在 CIFAR-10-C 数据集上展示了这一能力。

关键词

引用

@article{arxiv.2002.09364,
  title  = {Adversarial Detection and Correction by Matching Prediction Distributions},
  author = {Giovanni Vacanti and Arnaud Van Looveren},
  journal= {arXiv preprint arXiv:2002.09364},
  year   = {2020}
}

备注

13 pages, 16 figures. For an open source implementation of the algorithm, see https://github.com/SeldonIO/alibi-detect