中文

基于随机子空间分析的攻击无关对抗样本检测

计算机视觉与模式识别 2021-11-04 v2 人工智能 密码学与安全 机器学习

摘要

尽管对抗攻击检测已受到相当关注,但从两个角度看它仍是一个根本性的难题。首先,虽然威胁模型可以明确定义,但攻击者的策略在这些约束内仍可能千差万别。因此,检测应被视为一个开集问题,这与当前大多数检测方法形成对比。这些方法采取闭集视角并训练二分类检测器,从而使检测偏向于检测器训练期间所见过的攻击。其次,测试时可获得的信息有限,且通常受到包括图像标签和底层内容在内的干扰因素的混淆。我们通过一种基于随机子空间分析的新策略来应对这些挑战。我们提出了一种利用随机投影的性质来刻画干净样本与对抗样本在一组多样化子空间上行为的技术。该方法借助模型激活的一致性(或不一致性)来区分干净样本与对抗样本。性能评估表明,我们的技术(AUC[0.92,0.98]AUC\in[0.92, 0.98])优于竞争检测策略(AUC[0.30,0.79]AUC\in[0.30,0.79]),同时对攻击策略(针对有目标/无目标攻击)保持真正的无关性。并且,与竞争方法相比,它仅需显著更少的校准数据(仅由干净样本组成)即可达到该性能。

关键词

引用

@article{arxiv.2012.06405,
  title  = {Attack Agnostic Detection of Adversarial Examples via Random Subspace Analysis},
  author = {Nathan Drenkow and Neil Fendley and Philippe Burlina},
  journal= {arXiv preprint arXiv:2012.06405},
  year   = {2021}
}