Knockoff Nets:窃取黑盒模型的功能
计算机视觉与模式识别
2018-12-10 v1 密码学与安全
机器学习
摘要
机器学习(ML)模型正日益部署于实际环境中以执行广泛任务。在本文中,我们探讨 adversary 能在多大程度上仅基于黑盒交互(图像输入、预测输出)窃取此类“受害”模型的功能。与先前工作不同,我们呈现的 adversary 缺乏关于模型所用训练/测试数据、模型内部构造及模型输出语义的知识。我们将模型功能窃取表述为两步方法:(i)向黑盒模型查询一组输入图像以获得预测;(ii)用查询所得图像-预测对训练一个“knockoff”。我们作出若干显著观察:(a)从不同于黑盒训练数据的分布中查询随机图像可得到性能良好的knockoff;(b)即使knockoff采用不同架构表示,这也可行;(c)我们的强化学习方法在某些设定下额外提升了查询样本效率并带来性能增益。我们在一系列数据集与任务上,以及一个流行图像分析API上验证了模型功能窃取,其中我们以低至 $30 的代价创建了一个合理的knockoff。
引用
@article{arxiv.1812.02766,
title = {Knockoff Nets: Stealing Functionality of Black-Box Models},
author = {Tribhuvanesh Orekondy and Bernt Schiele and Mario Fritz},
journal= {arXiv preprint arXiv:1812.02766},
year = {2018}
}