中文

论 PGD 类对抗攻击的痕迹

计算机视觉与模式识别 2022-11-08 v2

摘要

对抗攻击给深度学习应用带来安全与安保隐患,但其特征尚待充分探究。尽管在很大程度上难以察觉,PGD 类攻击仍可能在对抗样本上留下强烈痕迹。回顾可知,PGD 类攻击触发了网络的“局部线性”,这意味着良性或对抗样本具有不同程度的线性。受此启发,我们构建了对抗响应特征(ARC)以反映模型在输入周围的梯度一致性,从而指示线性程度。在特定条件下,它定性地展现出从良性样本到对抗样本逐渐变化的模式,因为后者导致了续发攻击效应(SAE)。为定量评估 ARC 的有效性,我们在 CIFAR-10 和 ImageNet 上于一种具有挑战性的设定下进行了攻击检测与攻击类型识别实验。结果表明,SAE 是通过 ARC 特征反映的 PGD 类攻击的有效且独特的痕迹。ARC 特征直观、轻量、非侵入且对数据需求低。

关键词

引用

@article{arxiv.2205.09586,
  title  = {On Trace of PGD-Like Adversarial Attacks},
  author = {Mo Zhou and Vishal M. Patel},
  journal= {arXiv preprint arXiv:2205.09586},
  year   = {2022}
}