中文

攻击无关的对抗检测

计算机视觉与模式识别 2022-06-02 v1

摘要

近年来对抗攻击数量的不断增长使攻击方相对于防御方占据优势,因为防御方必须在知晓攻击类型后训练检测器,且需维护众多模型以确保对任一即将出现攻击的检测性能。我们提出一种将对抗攻击检测视为异常检测问题的方法,从而终结攻击方与防御方之间的拉锯战,使检测器对攻击无关。我们从两方面量化对抗扰动引起的统计偏离。最低显著分量特征(LSCF)量化对抗样本相对良性样本统计的偏离,而 Hessian 特征(HF)通过度量局部损失曲率反映对抗样本如何扭曲模型最优解的景观。实证结果表明,我们的方法在 CIFAR10、CIFAR100 和 SVHN 上分别取得 94.9%、89.7% 和 94.6% 的总体 ROC AUC,且在多数攻击上与使用对抗样本训练的对抗检测器性能相当。

关键词

引用

@article{arxiv.2206.00489,
  title  = {Attack-Agnostic Adversarial Detection},
  author = {Jiaxin Cheng and Mohamed Hussein and Jay Billa and Wael AbdAlmageed},
  journal= {arXiv preprint arXiv:2206.00489},
  year   = {2022}
}