Marich:一种利用公开数据实现查询高效且分布等价的模型提取攻击
机器学习
2023-10-19 v2 密码学与安全
机器学习
摘要
我们研究黑盒模型提取攻击的设计,该类攻击可从公开数据集中向目标 ML 模型通过预测 API 发送最少数量的查询,旨在创建目标模型的信息丰富且分布等价的副本。首先,我们定义分布等价和最大信息模型提取攻击,并将其归约为一个变分优化问题。攻击方依次求解该优化问题,以选择同时最大化熵并减小目标模型与窃取模型之间不匹配的最具信息量的查询。这导出了一个基于主动采样的查询选择算法 Marich,它与模型无关。随后,我们在不同文本和图像数据集以及不同模型(包括 CNN 和 BERT)上评估 Marich。Marich 提取的模型达到真实模型约 60-95% 的准确率,并使用来自公开可用数据集(与私有训练数据集不同)的约 1,000-8,500 次查询。与现有基于主动采样的攻击相比,Marich 提取的模型所产生的预测分布与目标分布接近约 2-4 倍。提取的模型在成员推断攻击下也达到 84-96% 的准确率。实验结果验证了 Marich 具有查询高效性,并且能够执行任务准确、高保真且信息丰富的模型提取。
引用
@article{arxiv.2302.08466,
title = {Marich: A Query-efficient Distributionally Equivalent Model Extraction Attack using Public Data},
author = {Pratik Karmakar and Debabrota Basu},
journal= {arXiv preprint arXiv:2302.08466},
year = {2023}
}
备注
Presented in the Privacy-Preserving AI (PPAI) workshop at AAAI 2023 as a spotlight talk and published in NeurIPS 2023