中文

低维对抗扰动的根源

机器学习 2022-07-05 v2 机器学习

摘要

在本文中,我们启动了对分类中低维对抗扰动(LDAPs)现象的严格研究。与经典设定不同,这些扰动被限制在维度为 kk 的子空间中,该维度远小于特征空间的维度 ddk=1k=1 的情况对应于所谓的通用对抗扰动(UAPs;Moosavi-Dezfooli 等人,2017)。首先,我们考虑在一般正则性条件(包括 ReLU 网络)下的二分类器,并计算任意子空间愚弄率(fooling rate)的解析下界。这些边界明确强调了愚弄率对模型的逐点间隔(即输出的 L2L_2 范数与其在测试点处梯度的比值)以及给定子空间与模型关于输入的梯度对齐程度的依赖。我们的结果为近期启发式方法高效生成低维对抗扰动的成提供了严格的解释。最后,我们证明如果一个决策区域是紧致的,那么它承认一个通用对抗扰动,其 L2L_2 范数比数据点的典型 L2L_2 范数小 d\sqrt{d} 倍。我们的理论结果在合成数据和真实数据的实验上得到了验证。

关键词

引用

@article{arxiv.2203.13779,
  title  = {Origins of Low-dimensional Adversarial Perturbations},
  author = {Elvis Dohmatob and Chuan Guo and Morgane Goibert},
  journal= {arXiv preprint arXiv:2203.13779},
  year   = {2022}
}