中文

利用局部本征维数刻画对抗子空间

机器学习 2018-03-15 v3 密码学与安全 计算机视觉与模式识别

摘要

深度神经网络(DNNs)近期被证明容易受到对抗样本的攻击,对抗样本是精心制作的实例,可误导 DNNs 在预测时出错。为了更好地理解此类攻击,需要对对抗样本所处的区域(所谓的“对抗子空间”)的性质进行刻画。我们通过使用局部本征维数(LID)来刻画对抗区域的维度性质以应对这一挑战。LID 基于示例到其邻居的距离分布,评估参考示例周围区域的空间填充能力。我们首先解释对抗扰动如何影响对抗区域的 LID 特征,然后实证表明 LID 特征有助于区分使用最优攻击生成的对抗样本。作为概念验证,我们展示了 LID 的一个潜在应用是区分对抗样本,初步结果表明,对于本文考虑的五种攻击策略和三个基准数据集,它的表现大幅优于几种最优检测度量。我们对对抗区域 LID 特征的分析不仅激发了有效对抗防御的新方向,也为开发新攻击以更好地理解 DNNs 的漏洞带来了更多挑战。

关键词

引用

@article{arxiv.1801.02613,
  title  = {Characterizing Adversarial Subspaces Using Local Intrinsic Dimensionality},
  author = {Xingjun Ma and Bo Li and Yisen Wang and Sarah M. Erfani and Sudanthi Wijewickrema and Grant Schoenebeck and Dawn Song and Michael E. Houle and James Bailey},
  journal= {arXiv preprint arXiv:1801.02613},
  year   = {2018}
}