中文

GAMIN:一种黑盒模型反演的对抗方法

机器学习 2019-09-27 v1 机器学习

摘要

近期工作表明机器学习模型易受模型反演攻击,导致其所训练数据集中包含的敏感信息暴露。尽管过去已开发出一些黑盒攻击设定下的模型反演攻击(即攻击者无法直接访问模型结构),但迄今为止极少有针对深度神经网络等复杂模型的此类攻击。本文中,我们引入 GAMIN(Generative Adversarial Model INversion,生成对抗模型反演),一种新的黑盒模型反演攻击框架,即使在针对卷积神经网络等深度模型时也能以合理计算代价取得显著结果。GAMIN 基于对受攻击目标模型的代理模型以及生成器的持续训练,生成器的目标是生成类似于用于训练目标模型的输入。该攻击针对用作图像分类器的各种神经网络进行了验证。特别地,当攻击在 MNIST 数据集上训练的模型时,GAMIN 能够针对目标所产生的多达 60% 的标签提取出可识别的数字。针对在 pilot parliament 数据集上训练的皮肤分类模型的攻击也展示了从目标中提取可识别特征的能力。

关键词

引用

@article{arxiv.1909.11835,
  title  = {GAMIN: An Adversarial Approach to Black-Box Model Inversion},
  author = {Ulrich Aïvodji and Sébastien Gambs and Timon Ther},
  journal= {arXiv preprint arXiv:1909.11835},
  year   = {2019}
}