用于生成对抗样本的孪生网络
机器学习
2018-05-04 v1 机器学习
摘要
机器学习模型易受对抗样本攻击。攻击者修改输入数据,使得人类仍赋予其相同标签,然而机器学习模型却将其误分类。文献中先前的方法表明,甚至可以为远程托管的模型生成对抗样本。在本文中,我们提出一种基于孪生网络的方法,为多类目标CNN生成对抗样本。我们假设攻击者不掌握目标数据分布的任何知识,并使用无标签的不匹配数据集来查询目标,例如,对于ResNet-50目标,我们使用Food-101数据集作为查询。最初,目标模型为查询数据集分配标签,并在由这些多类标签导出的图像对上训练孪生网络。我们为孪生模型学习对抗扰动,并表明这些扰动相对于目标模型也是对抗性的。在实验结果中,我们展示了我们的方法在MNIST、CIFAR-10和ImageNet目标上配合TinyImageNet/Food-101查询数据集的有效性。
引用
@article{arxiv.1805.01431,
title = {Siamese networks for generating adversarial examples},
author = {Mandar Kulkarni and Aria Abubakar},
journal= {arXiv preprint arXiv:1805.01431},
year = {2018}
}