一种面向带目标对抗样本的通用框架
计算机视觉与模式识别
2019-04-05 v2 密码学与安全
摘要
被微妙扰动以致被神经网络误分类的图像称为对抗样本,已成为一个技术上的深层挑战,也是若干应用领域的重要关切。大多数关于对抗样本的研究仅以扰动图像与原始图像相似为约束。然而,这些思想的真实世界应用通常要求样本满足额外目标,而这些目标一般通过对扰动过程的定制修改来强制实现。本文提出对抗生成网络(AGNs),一种训练生成器神经网络以产生满足期望目标的对抗样本的通用方法。我们在两个应用领域展示了 AGNs 适应广泛目标的能力,包括难以建模的不精确目标。具体而言,我们展示了物理对抗样本——旨在欺骗人脸识别的眼镜框——相比先前方法具有更好的鲁棒性、隐蔽性和可扩展性,以及一种欺骗手写数字分类器的新攻击。
引用
@article{arxiv.1801.00349,
title = {A General Framework for Adversarial Examples with Objectives},
author = {Mahmood Sharif and Sruti Bhagavatula and Lujo Bauer and Michael K. Reiter},
journal= {arXiv preprint arXiv:1801.00349},
year = {2019}
}
备注
Accepted for publication at ACM TOPS