中文

用于生成对抗样本的孪生网络

机器学习 2018-05-04 v1 机器学习

摘要

机器学习模型易受对抗样本攻击。攻击者修改输入数据,使得人类仍赋予其相同标签,然而机器学习模型却将其误分类。文献中先前的方法表明,甚至可以为远程托管的模型生成对抗样本。在本文中,我们提出一种基于孪生网络的方法,为多类目标CNN生成对抗样本。我们假设攻击者不掌握目标数据分布的任何知识,并使用无标签的不匹配数据集来查询目标,例如,对于ResNet-50目标,我们使用Food-101数据集作为查询。最初,目标模型为查询数据集分配标签,并在由这些多类标签导出的图像对上训练孪生网络。我们为孪生模型学习对抗扰动,并表明这些扰动相对于目标模型也是对抗性的。在实验结果中,我们展示了我们的方法在MNIST、CIFAR-10和ImageNet目标上配合TinyImageNet/Food-101查询数据集的有效性。

关键词

引用

@article{arxiv.1805.01431,
  title  = {Siamese networks for generating adversarial examples},
  author = {Mandar Kulkarni and Aria Abubakar},
  journal= {arXiv preprint arXiv:1805.01431},
  year   = {2018}
}