中文

生成(非软件)缺陷以欺骗分类器

机器学习 2019-11-21 v1 密码学与安全 机器学习

摘要

在旨在迷惑深度学习模型的对抗攻击中,大多数研究集中于限制修改的幅度,以使人类不会察觉攻击。另一方面,例如在针对自动驾驶汽车的攻击中,大多数驾驶员若看到停车标志上放置了小型昆虫图像,并不会觉得奇怪,或者可能会忽略它。在本文中,我们提出一种系统的方法,通过采用模仿特定物体或信号的自然外观扰动,来生成针对分类模型的自然对抗样本。我们首先通过采用生成对抗网络(GAN)来产生具有自然物体外观的图像块以欺骗目标模型,展示了该方法在针对图像分类器的攻击中的可行性。我们还引入了一种算法,根据输入图像优化扰动的位置,这使得对抗样本的生成快速且更可能成功。此外,我们通过实验表明,所提出的方法可扩展到音频领域,例如生成听起来像鸟鸣的扰动以欺骗语音分类器。

关键词

引用

@article{arxiv.1911.08644,
  title  = {Generate (non-software) Bugs to Fool Classifiers},
  author = {Hiromu Yakura and Youhei Akimoto and Jun Sakuma},
  journal= {arXiv preprint arXiv:1911.08644},
  year   = {2019}
}

备注

Accepted by AAAI 2020