透视下白盒成员推断:通过可解释性探索白盒成员推断
机器学习
2024-07-02 v1 密码学与安全
摘要
深度学习应用日益增长,个人化数据依赖日益增强,凸显了针对隐私漏洞的紧迫需求,尤其是成员推断攻击 (MIA)。尽管已有大量 MIA 研究,但关于隐藏特征(单独作用)对攻击效果的影响以及基于原始数据特征解释攻击根本原因的知识仍存在显著缺口。本文旨在通过以下方式弥补这些知识缺口:首先探索统计方法以识别最具信息量的神经元,并量化从所选神经元中提取的隐藏激活对攻击准确率的重要性,既单独作用又组合作用。此外,我们提出一种攻击驱动的可解释框架,通过整合目标模型和攻击模型来识别导致成功成员推断攻击的最具影响力的原始数据特征。我们提出的 MIA 在最先进的 MIA 上实现了最高可达 26% 的提升。
引用
@article{arxiv.2407.01306,
title = {Unveiling the Unseen: Exploring Whitebox Membership Inference through the Lens of Explainability},
author = {Chenxi Li and Abhinav Kumar and Zhen Guo and Jie Hou and Reza Tourani},
journal= {arXiv preprint arXiv:2407.01306},
year = {2024}
}
备注
20 pages, 10 figures, 4 tables