利用生成模型学习通用对抗扰动
密码学与安全
2018-01-08 v3 机器学习
机器学习
摘要
众所周知,神经网络容易受到对抗样本的攻击,这些输入经过有意扰动,在视觉上与源输入保持相似,但会导致错误分类。最近研究表明,给定一个数据集和分类器,存在所谓的通用对抗扰动,即当应用于任何输入时都会导致错误分类的单一扰动。在这项工作中,我们引入了通用对抗网络,这是一种生成网络,当其生成的输出被添加到数据集中的干净样本时,能够欺骗目标分类器。我们证明,该技术改进了已知的通用对抗攻击方法。
引用
@article{arxiv.1708.05207,
title = {Learning Universal Adversarial Perturbations with Generative Models},
author = {Jamie Hayes and George Danezis},
journal= {arXiv preprint arXiv:1708.05207},
year = {2018}
}