中文

验证对抗样本的成因

机器学习 2020-10-20 v1

摘要

神经网络的鲁棒性受到对抗样本的挑战,这些样本包含对输入几乎难以察觉的扰动,以高置信度误导分类器产生错误输出。由于彻底检查高维图像空间的极大困难,关于解释和论证对抗样本成因的研究落后于攻击与防御的研究。在本文中,我们收集了对抗样本的一系列潜在成因,并通过精心设计的对照实验验证(或部分验证)它们。对抗样本的主要成因包括模型线性、单和约束以及类别的几何结构。为控制这些成因的影响,我们应用了多种技术,如L2L_2归一化、损失函数替换、参考数据集构建,以及使用多层感知机概率神经网络(MLP-PNN)和密度估计(DE)的新颖模型。我们的实验结果表明,几何因素往往是更直接的成因,而统计因素放大了该现象,尤其是在赋予高预测置信度方面。我们相信本文将启发更多研究去严格探究对抗样本的根本成因,进而为设计更鲁棒的模型提供有益指导。

关键词

引用

@article{arxiv.2010.09633,
  title  = {Verifying the Causes of Adversarial Examples},
  author = {Honglin Li and Yifei Fan and Frieder Ganz and Anthony Yezzi and Payam Barnaghi},
  journal= {arXiv preprint arXiv:2010.09633},
  year   = {2020}
}