MEGA:基于协作式生成器-替代网络的模型窃取方法
密码学与安全
2022-02-02 v1 人工智能
机器学习
摘要
深度机器学习模型正日益部署于实际环境中以为用户提供服。攻击者可通过根据目标部署模型的推理结果训练替代模型来窃取这些宝贵模型的知识。近期无数据模型窃取方法被证明能在不使用真实查询样本的情况下有效提取目标模型的知识,但它们假设了丰富的推理信息,例如类概率与logits。然而,它们均基于竞争式生成器-替代网络,因此遭遇训练不稳定问题。本文提出一种无数据模型窃取框架MEGA,其基于协作式生成器-替代网络,且仅要求目标模型对合成查询样本提供标签预测。我们方法的核心是一种模型窃取优化,由两种协作模型组成:(i)替代模型,其通过合成查询样本及其推断标签来模仿目标模型;(ii)生成器,其合成图像以使替代模型对每个查询样本的置信度最大化。我们提出了一种新颖的坐标下降训练过程并分析了其收敛性。我们还在三个数据集上对所训练的替代模型及其在黑盒对抗攻击上的应用进行了实证评估。我们的结果表明,我们所训练替代模型的准确率以及在其上的对抗攻击成功率可比最先进的无数据黑盒攻击分别高出至多33%和40%。
引用
@article{arxiv.2202.00008,
title = {MEGA: Model Stealing via Collaborative Generator-Substitute Networks},
author = {Chi Hong and Jiyue Huang and Lydia Y. Chen},
journal= {arXiv preprint arXiv:2202.00008},
year = {2022}
}