中文

利用复合无标签数据从受保护深度神经网络中窃取知识

机器学习 2019-12-10 v1 密码学与安全 神经与进化计算 机器学习

摘要

随着最先进的深度神经网络被部署于更先进的基于 AI 的产品和服务的核心,竞争对手对手复制它们(即其知识产权)的动机预计会随时间大幅增加。从此类网络中提取或窃取知识的最佳方式是使用大量随机样本数据集查询它们并记录其输出,随后训练一个学生网络来模仿这些输出,而不对原始网络做任何假设。抵御此类模仿攻击最有效的方式是仅提供分类结果,而不提供与 softmax 层相关的置信度值。在本文中,我们提出了一种利用学生模型生成复合图像以攻击导师神经网络的新方法。我们的方法假设关于导师的训练数据集、架构或权重无任何信息。进一步假设关于导师的 softmax 输出值无任何信息,我们的方法成功模仿了给定神经网络并窃取了其全部知识。我们还证明我们的学生网络(复制了导师)对水印保护方法免疫,因此不会被检测为被盗模型。我们的结果本质上意味着,所有当前的神经网络都易受模仿攻击,即使它们除最基本所需的输出外不泄露任何信息,并且模仿它们的学生模型无法利用当前可用技术被轻易检测并识别为被盗副本。

关键词

引用

@article{arxiv.1912.03959,
  title  = {Stealing Knowledge from Protected Deep Neural Networks Using Composite Unlabeled Data},
  author = {Itay Mosafi and Eli David and Nathan S. Netanyahu},
  journal= {arXiv preprint arXiv:1912.03959},
  year   = {2019}
}