中文

针对机器学习的实用黑盒攻击

密码学与安全 2017-03-21 v4 机器学习

摘要

机器学习(ML)模型,例如深度神经网络(DNNs),易受对抗样本的攻击:被恶意修改以产生错误模型输出的输入,同时在人类观察者看来未被修改。潜在的攻击包括将恶意内容(如恶意软件)识别为合法,或控制车辆行为。然而,所有现有的对抗样本攻击都需要了解模型内部或其训练数据。我们首次实际演示了攻击者在无任何此类知识的情况下控制远程托管的DNN。事实上,我们的黑盒攻击者唯一的能力是观察DNN对选定输入给出的标签。我们的攻击策略包括训练一个本地模型来替代目标DNN,使用由攻击者合成生成并由目标DNN标记的输入。我们利用本地替代模型来精心制造对抗样本,并发现它们被目标DNN错误分类。为了进行真实世界且适当盲化的评估,我们攻击了由在线深度学习API MetaMind托管的DNN。我们发现其DNN对我们替代模型制造的对抗样本的错误分类率达到84.24%。我们通过针对Amazon和Google托管的模型使用逻辑回归替代模型进行相同攻击,证明了我们的策略对许多ML技术的普遍适用性。它们产生的对抗样本被Amazon和Google错误分类的比率分别为96.19%和88.94%。我们还发现,这种黑盒攻击策略能够规避先前发现的使对抗样本制造更困难的防御策略。

关键词

引用

@article{arxiv.1602.02697,
  title  = {Practical Black-Box Attacks against Machine Learning},
  author = {Nicolas Papernot and Patrick McDaniel and Ian Goodfellow and Somesh Jha and Z. Berkay Celik and Ananthram Swami},
  journal= {arXiv preprint arXiv:1602.02697},
  year   = {2017}
}

备注

Proceedings of the 2017 ACM Asia Conference on Computer and Communications Security, Abu Dhabi, UAE