MAZE:基于零阶梯度估计的无数据模型窃取攻击
机器学习
2022-11-02 v2 机器学习
摘要
模型窃取(MS)攻击允许对机器学习模型具有黑盒访问权限的对手复制其功能,从而损害模型的机密性。此类攻击通过使用目标模型对不同输入的预测来训练克隆模型。此类攻击的有效性严重依赖于查询目标模型所需数据的可用性。现有攻击要么假设对目标模型的数据集有部分访问权限,要么假设存在具有语义相似性的替代数据集。本文提出 MAZE——一种使用零阶梯度估计的无数据模型窃取攻击。与先前工作相反,MAZE 不需要任何数据,而是使用生成模型创建合成数据。受近期无数据知识蒸馏(KD)工作的启发,我们使用不一致目标训练生成模型,以产生使克隆模型与目标模型之间不一致最大化的输入。然而,与梯度信息可用的 KD 白盒设定不同,用于模型窃取的生成器训练需要执行黑盒优化,因为它涉及访问受攻击的目标模型。MAZE 依靠零阶梯度估计来执行该优化,并实现高精度的 MS 攻击。我们对四个数据集的评估表明,MAZE 提供的归一化克隆精度在 0.91x 到 0.99x 范围内,并且优于甚至依赖部分数据(JBDA,克隆精度 0.13x 到 0.69x)和替代数据(KnockoffNets,克隆精度 0.52x 到 0.97x)的近期攻击。我们还研究了 MAZE 在部分数据设定下的扩展,并开发了 MAZE-PD,它生成更接近目标分布的合成数据。MAZE-PD 进一步提高了克隆精度(0.97x 到 1.0x),并将攻击所需查询减少了 2x-24x。
引用
@article{arxiv.2005.03161,
title = {MAZE: Data-Free Model Stealing Attack Using Zeroth-Order Gradient Estimation},
author = {Sanjay Kariyappa and Atul Prakash and Moinuddin Qureshi},
journal= {arXiv preprint arXiv:2005.03161},
year = {2022}
}