Fisher信息度量下的对抗攻击与检测
机器学习
2019-02-12 v2 机器学习
摘要
许多深度学习模型易受对抗攻击,即对输入的难以察觉但刻意设计的扰动可导致网络输出错误。本文利用信息几何,为深度学习模型的脆弱性提供了合理解释。通过将数据空间视为由神经网络诱导具有Fisher信息度量的非线性空间,我们首先提出一种称为一步谱攻击(OSSA)的对抗攻击算法。该方法由Fisher信息矩阵的约束二次型描述,其中最优对抗扰动由第一特征向量给出,模型脆弱性由特征值反映。特征值越大,模型越易被相应特征向量攻击。利用该性质,我们还提出了一种以特征值为特征的对抗检测方法。我们的攻击与检测算法均在数值上优化以在大型数据集上高效工作。评估显示相较其他方法具有更优性能,表明Fisher信息是研究对抗攻击与防御的有前景途径。
引用
@article{arxiv.1810.03806,
title = {The Adversarial Attack and Detection under the Fisher Information Metric},
author = {Chenxiao Zhao and P. Thomas Fletcher and Mixue Yu and Yaxin Peng and Guixu Zhang and Chaomin Shen},
journal= {arXiv preprint arXiv:1810.03806},
year = {2019}
}
备注
Accepted as an AAAI-2019 oral paper