神经网络的表征质量与对抗攻击及防御的关联
计算机视觉与模式识别
2020-07-17 v5 机器学习
神经与进化计算
摘要
神经网络已被证明易受多种对抗算法的攻击。理解这种缺乏鲁棒性之原因的关键一步是评估神经网络表征编码现有特征的潜力。在此,我们提出一种利用基于零样本学习(Zero-Shot Learning)的新测试(称为 Raw Zero-Shot)来理解神经网络表征质量的方法。其核心思想是,若算法学习了丰富特征,则这些特征应能将“未知”类解释为先前学习特征的聚合。这是因为未知类通常与已识别类共享若干常规特征,前提是所学特征足够通用。我们进一步引入两个度量来评估这些所学特征对未知类的解释能力。一个基于簇间验证技术(Davies-Bouldin 指数),另一个基于到近似真值的距离。实验表明,对抗防御改善了分类器的表征,进一步提示若要提升分类器的鲁棒性,也必须提升表征质量。实验还揭示了度量与对抗攻击之间的强关联(高 Pearson 相关系数与低 p 值)。有趣的是,结果表明诸如 CapsNet 之类的动态路由网络具有更好的表征,而当前更深的神经网络正以表征质量换取准确率。代码见 http://bit.ly/RepresentationMetrics。
引用
@article{arxiv.1906.06627,
title = {Representation Quality Of Neural Networks Links To Adversarial Attacks and Defences},
author = {Shashank Kotyan and Danilo Vasconcellos Vargas and Moe Matsuki},
journal= {arXiv preprint arXiv:1906.06627},
year = {2020}
}