关于 Shapley 值的特征推断攻击
机器学习
2024-07-17 v1 人工智能
密码学与安全
摘要
作为合作博弈论中的解概念,Shapley 值在模型可解释性研究中备受推崇,被众多主流机器学习即服务(MLaaS)提供商采纳,如 Google、Microsoft 和 IBM。然而,尽管基于 Shapley 值的模型可解释性方法已受到广泛研究,少有研究者关注 Shapley 值所带来的隐私风险,尽管可解释性与隐私是机器学习模型的两个基础。在本文中,我们使用特征推断攻击探讨基于 Shapley 值的模型可解释性方法的隐私风险,即通过其 Shapley 值解释重建私有模型输入。具体而言,我们提出两种对手。第一种对手可基于辅助数据集和对模型可解释性服务的黑盒访问权限,通过训练攻击模型来重建私有输入。第二种对手即使没有任何背景知识,也能通过利用模型输入与输出之间的局部线性相关性成功重建大多数私有特征。我们在主要的 MLaaS 平台上进行了实验,即 Google Cloud、Microsoft Azure 和 IBM aix360。实验结果表明,当前主流 MLaaS 平台上使用的基于 Shapley 值的模型可解释性方法存在安全漏洞,凸显了在未来研究中设计隐私保护模型可解释性方法的重要性和必要性。据我们所知,这也是首个研究 Shapley 值隐私风险的工作。
引用
@article{arxiv.2407.11359,
title = {Feature Inference Attack on Shapley Values},
author = {Xinjian Luo and Yangfan Jiang and Xiaokui Xiao},
journal= {arXiv preprint arXiv:2407.11359},
year = {2024}
}
备注
This work was published in CCS 2022