中文

神经网络的高精度与高保真提取

机器学习 2020-03-05 v2 密码学与安全 机器学习

摘要

在模型提取攻击中,给定预言机预测访问权限,攻击者窃取一份远程部署的机器学习模型的副本。我们围绕两个目标对模型提取攻击进行分类:*精度*,即在底层学习任务上表现良好;以及*保真度*,即对任意输入匹配远程受害分类器的预测。为提取高精度模型,我们开发了一种基于学习的攻击,利用受害者来监督提取模型的训练。通过分析与经验论证,我们随后解释了阻止任何基于学习的策略提取真正高保真模型——即提取在全部可能输入上预测与受害模型完全相同的函数等价模型——的内在局限。针对这些局限,我们在先前工作基础上开发了首个实用的函数等价提取攻击,用于直接提取(即无需训练)模型权重。我们在学术数据集及一个用10亿张专有图像训练的最先进图像分类器上进行了实验。除了拓宽模型提取研究的范围,我们的工作还展示了针对生产级系统的模型提取攻击的实用性。

关键词

引用

@article{arxiv.1909.01838,
  title  = {High Accuracy and High Fidelity Extraction of Neural Networks},
  author = {Matthew Jagielski and Nicholas Carlini and David Berthelot and Alex Kurakin and Nicolas Papernot},
  journal= {arXiv preprint arXiv:1909.01838},
  year   = {2020}
}

备注

USENIX Security 2020, 18 pages, 6 figures