针对深度网络的成员模型反演攻击
机器学习
2019-10-11 v1 机器学习
摘要
随着 AI 的日益普及,机器学习系统固有的安全与隐私漏洞正不断被发现。其中一种漏洞使得攻击者能够获取用于训练目标机器学习模型的实例类型的私有信息。这种所谓的模型反演攻击基于依次利用分类分数,以获得各类别的高置信度表示。然而,对于深度网络,此类过程通常导致无法识别、对攻击者无用的表示。在本文中,我们引入了更现实的模型反演定义:攻击者知晓被攻击模型的总体用途(例如,它是 OCR 系统还是人脸识别系统),且目标是在相应的低维流形(分别为通用符号或通用人脸)内找到真实的类别表示。为此,我们利用生成对抗网络(generative adversarial networks)的性质来构建连通的低维流形,并展示了在该流形内执行的模型反演攻击的有效性。
引用
@article{arxiv.1910.04257,
title = {Membership Model Inversion Attacks for Deep Networks},
author = {Samyadeep Basu and Rauf Izmailov and Chris Mesterharm},
journal= {arXiv preprint arXiv:1910.04257},
year = {2019}
}
备注
NeurIPS 2019, Workshop on Privacy in Machine Learning