中文

生成具有优化质量的对抗样本

计算机视觉与模式识别 2020-07-02 v1 机器学习

摘要

深度学习模型广泛应用于计算机视觉、计算机安全等诸多领域。然而,深度学习模型易受对抗样本(Adversarial Examples, AEs)攻击——即精心构造以欺骗这些模型的样本。近期研究提出了新的对抗攻击方法,但据我们所知,除误分类率(Misclassification Rate, MR)等简单质量度量外,没有方法在构造时为保证样本质量提供保证。本文中,我们将图像质量评估(Image Quality Assessment, IQA)指标纳入AE的设计与生成过程。我们提出基于进化的单目标与多目标优化方法,生成高误分类率且显式提升质量(即不可区分性)的AE,同时仅扰动有限数量的像素。具体地,若干IQA指标(包括边缘分析、傅里叶分析和特征描述子)被引入AE生成过程。基于进化的算法之独特特性使我们能同时优化AE的误分类率与IQA指标。为评估所提方法性能,我们在不同知名基准数据集(MNIST、CIFAR、GTSRB及Open Image Dataset V5)上进行了充分实验,并考虑多种目标优化配置。与现有攻击方法相比,实验结果验证了我们的初始假设:在AE生成过程中使用IQA指标可显著提升其质量,同时保持高误分类率。最后给出了可迁移性与人类感知研究,展示了可接受的性能。

关键词

引用

@article{arxiv.2007.00146,
  title  = {Generating Adversarial Examples with an Optimized Quality},
  author = {Aminollah Khormali and DaeHun Nyang and David Mohaisen},
  journal= {arXiv preprint arXiv:2007.00146},
  year   = {2020}
}