基于 GAN 的域推断攻击
机器学习
2022-12-23 v1 人工智能
密码学与安全
摘要
基于模型的攻击可以从深度神经网络模型中推断出训练数据信息。这些攻击严重依赖攻击者对应用域的了解,例如利用它来确定模型反演攻击的辅助数据。然而,攻击者可能不知道模型在实际中用于什么。我们提出一种基于生成对抗网络(GAN)的方法来探索目标模型可能或相似的域——模型域推断(MDI)攻击。对于给定的目标(分类)模型,我们假设攻击者除输入和输出格式外一无所知,并且可以使用模型对所需格式的任何输入导出预测。我们的基本思想是利用目标模型影响易于获取的候选域数据集上的 GAN 训练过程。我们发现,如果域与目标域越相似,目标模型对训练过程的干扰就越小。然后,我们用 GAN 生成数据集之间的距离来度量干扰水平,该距离可用于对目标模型的候选域进行排序。我们的实验表明,来自 MDI 排名靠前域的辅助数据集能有效提升模型反演攻击的效果。
引用
@article{arxiv.2212.11810,
title = {GAN-based Domain Inference Attack},
author = {Yuechun Gu and Keke Chen},
journal= {arXiv preprint arXiv:2212.11810},
year = {2022}
}
备注
accepted by AAAI23