中文

仅用噪声输入窃取模型权重:任性好攻手的奇怪案例

机器学习 2019-12-20 v1 密码学与安全 机器学习

摘要

本文探讨了在何种场景下,攻击者可声称“噪声和对模型 softmax 层的访问即足以”窃取架构已知的卷积神经网络的权重。我们使用仅由 i.i.d. Bernoulli 噪声输入学习到的窃取 MNIST 模型达到了 96% 的测试准确率,使用窃取的 KMNIST 模型达到了 82% 的准确率。我们假定权重的这种易窃性表明了数据集的复杂度,并提出了一种捕捉该性质的新度量。本传播的目的一是展示在模型窃取方面知晓架构能走多远,二是引起对由 i.i.d. 噪声输入激发的 CNN 这种相当特异的权重可学习性方面的关注。我们还传播了一些使用 Ising 概率分布替代 i.i.d. Bernoulli 分布所获得的初步结果。

关键词

引用

@article{arxiv.1912.08987,
  title  = {Model Weight Theft With Just Noise Inputs: The Curious Case of the Petulant Attacker},
  author = {Nicholas Roberts and Vinay Uday Prabhu and Matthew McAteer},
  journal= {arXiv preprint arXiv:1912.08987},
  year   = {2019}
}

备注

Presented at the Security and Privacy of Machine Learning Workshop, 36th International Conference on Machine Learning (ICML 2019), Long Beach, California, USA