仅用噪声输入窃取模型权重:任性好攻手的奇怪案例
机器学习
2019-12-20 v1 密码学与安全
机器学习
摘要
本文探讨了在何种场景下,攻击者可声称“噪声和对模型 softmax 层的访问即足以”窃取架构已知的卷积神经网络的权重。我们使用仅由 i.i.d. Bernoulli 噪声输入学习到的窃取 MNIST 模型达到了 96% 的测试准确率,使用窃取的 KMNIST 模型达到了 82% 的准确率。我们假定权重的这种易窃性表明了数据集的复杂度,并提出了一种捕捉该性质的新度量。本传播的目的一是展示在模型窃取方面知晓架构能走多远,二是引起对由 i.i.d. 噪声输入激发的 CNN 这种相当特异的权重可学习性方面的关注。我们还传播了一些使用 Ising 概率分布替代 i.i.d. Bernoulli 分布所获得的初步结果。
引用
@article{arxiv.1912.08987,
title = {Model Weight Theft With Just Noise Inputs: The Curious Case of the Petulant Attacker},
author = {Nicholas Roberts and Vinay Uday Prabhu and Matthew McAteer},
journal= {arXiv preprint arXiv:1912.08987},
year = {2019}
}
备注
Presented at the Security and Privacy of Machine Learning Workshop, 36th International Conference on Machine Learning (ICML 2019), Long Beach, California, USA