中文

多重攻击:多张图像 + 同一对抗攻击 → 多个目标标签

计算机视觉与模式识别 2023-08-09 v1 密码学与安全 机器学习

摘要

我们展示了可以轻松设计单一对抗扰动PP,将nn张图像X1,X2,,XnX_1,X_2,\dots,X_n从其原始未扰动类别c1,c2,,cnc_1, c_2,\dots,c_n一次性改变为期望的(未必全部相同)类别c1,c2,,cnc^*_1,c^*_2,\dots,c^*_n,可同时针对多达数百张图像和目标类别。我们称这些为多重攻击(multi-attacks)。在不同条件(如图像分辨率)下刻画可达到的最大nn,我们估计在像素空间中特定图像周围高类别置信度区域的数量约为10O(100)10^{\mathcal{O}(100)},这对穷举防御策略构成了显著问题。我们展示了其若干直接后果:基于强度改变结果类别的对抗攻击,以及尺度无关的对抗样本。为展示像素空间中类别决策边界的冗余性与丰富性,我们寻找其二维截面,利用特定类别追踪图像并拼写出单词。我们还表明集成可降低对多重攻击的敏感性,而在随机标签上训练的分类器更易受影响。我们的代码已在GitHub上提供。

关键词

引用

@article{arxiv.2308.03792,
  title  = {Multi-attacks: Many images $+$ the same adversarial attack $\to$ many target labels},
  author = {Stanislav Fort},
  journal= {arXiv preprint arXiv:2308.03792},
  year   = {2023}
}

备注

Code at https://github.com/stanislavfort/multi-attacks