中文

确定用于检测对抗攻击的图像处理技术序列

计算机视觉与模式识别 2021-08-26 v2 人工智能

摘要

从对抗样本开发安全的机器学习模型具有挑战性,因为各种生成对抗攻击的方法在不断被提出。在这项工作中,我们提出一种进化方法,自动确定用于检测恶意输入的图像处理技术序列(IPTS)。相应地,我们首先使用一组多样的攻击方法(包括针对我们防御的自适应攻击方法)从干净数据集生成对抗样本。开发了一种基于遗传算法(GA)的检测框架来寻找最优的 IPTS,其中最优性由不同的适应度度量估计,如欧氏距离、熵损失、平均直方图、局部二值模式和损失函数。原始图像与处理后图像之间的“图像差异”被用于提取特征,然后将这些特征输入分类方案,以判断输入样本是对抗样本还是干净样本。本文描述了我们的方法,并使用多个数据集在多种对抗攻击下进行了实验。对于每种攻击类型和数据集,它生成独特的 IPTS。在测试时动态选择一组 IPTS,其作为对抗攻击的过滤器。我们的实证实验显示出有前景的结果,表明该方法可有效用作任何 AI 模型的处理环节。

关键词

引用

@article{arxiv.2007.00337,
  title  = {Determining Sequence of Image Processing Technique (IPT) to Detect Adversarial Attacks},
  author = {Kishor Datta Gupta and Zahid Akhtar and Dipankar Dasgupta},
  journal= {arXiv preprint arXiv:2007.00337},
  year   = {2021}
}