中文

机器学习中的可迁移性:从现象到使用对抗样本的黑盒攻击

密码学与安全 2016-05-25 v1 机器学习

摘要

许多机器学习模型容易受到对抗样本的攻击:这些输入经过特殊构造,旨在使机器学习模型产生错误的输出。影响一个模型的对抗样本往往也会影响另一个模型,即使这两个模型具有不同的架构或是在不同的训练集上训练的,只要它们都被训练来执行相同的任务。因此,攻击者可以训练自己的替代模型,针对该替代模型构造对抗样本,并在对受害模型知之甚少的情况下将其迁移到受害模型。近期的工作进一步发展了一种技术,该技术利用受害模型作为预言机,为替代模型标记一个合成训练集,因此攻击者甚至无需收集训练集即可发起攻击。我们扩展了这些近期技术,利用蓄水池采样大幅提高了替代模型训练过程的效率。我们引入了在先前未被探索过的机器学习模型类别对(替代模型,受害模型)之间的新型可迁移性攻击,最显著的是支持向量机(SVM)和决策树。我们仅通过800次对受害模型的查询,就在亚马逊(96.19%的错误分类率)和谷歌(88.94%)的两个商用机器学习分类系统上演示了我们的攻击,从而表明现有的机器学习方法无论其结构如何,普遍容易受到系统性的黑盒攻击。

关键词

引用

@article{arxiv.1605.07277,
  title  = {Transferability in Machine Learning: from Phenomena to Black-Box Attacks using Adversarial Samples},
  author = {Nicolas Papernot and Patrick McDaniel and Ian Goodfellow},
  journal= {arXiv preprint arXiv:1605.07277},
  year   = {2016}
}