中文

硬标签设定下的无数据模型窃取

密码学与安全 2022-04-26 v1 计算机视觉与模式识别

摘要

作为服务部署的机器学习模型(MLaaS)易受模型窃取攻击,其中 adversary 试图在受限访问框架下窃取模型。虽然现有攻击利用分类网络的 softmax 预测展示了近乎完美的克隆模型性能,但大多数 API 仅允许访问 top-1 标签。在本文中,我们表明,仅通过访问 top-1 预测(硬标签设定)、不访问模型梯度(黑盒设定)甚至训练数据集(无数据设定),在较低查询预算内确实可以窃取机器学习模型。我们提出了一种新颖的基于 GAN 的框架,该框架串联训练学生网络和生成器以有效窃取模型,同时利用克隆网络梯度作为受害者梯度的代理来克服硬标签设定的挑战。我们提出通过利用公开可用(可能不相关)的数据集作为弱图像先验,来克服典型无数据设定所伴随的高查询成本。我们还额外表明,即使缺乏此类数据,使用合成构造的样本也能在较低查询预算内达到最先进的性能。我们首次展示了在 100 类数据集上受限访问设定中模型窃取的可扩展性。

关键词

引用

@article{arxiv.2204.11022,
  title  = {Towards Data-Free Model Stealing in a Hard Label Setting},
  author = {Sunandini Sanyal and Sravanti Addepalli and R. Venkatesh Babu},
  journal= {arXiv preprint arXiv:2204.11022},
  year   = {2022}
}

备注

CVPR 2022, Project Page: https://sites.google.com/view/dfms-hl