中文

基于特征解释的隐私图提取

机器学习 2023-11-03 v2 密码学与安全

摘要

隐私性与可解释性是实现可信机器学习的两个重要要素。我们通过图重构攻击研究图机器学习中这两个方面的相互作用。此处攻击者的目标是在能够访问模型解释的情况下重构训练数据的图结构。基于攻击者可用的不同辅助信息,我们提出了若干图重构攻击方法。我们表明,额外获知事后特征解释会显著提高这些攻击的成功率。进一步,我们详细研究了针对图神经网络的三类不同解释方法——基于梯度的、基于扰动的以及基于替代模型的方法——在攻击性能上的差异。虽然基于梯度的解释在图结构方面泄露最多,我们发现这些解释在效用上并不总是得分高。对于另外两类解释,隐私泄露随解释效用的提高而增加。最后,我们提出一种基于随机响应机制的解释发布防御方法,其大幅降低了攻击成功率。我们的代码可在 https://github.com/iyempissy/graph-stealing-attacks-with-explanation 获取。

关键词

引用

@article{arxiv.2206.14724,
  title  = {Private Graph Extraction via Feature Explanations},
  author = {Iyiola E. Olatunji and Mandeep Rathee and Thorben Funke and Megha Khosla},
  journal= {arXiv preprint arXiv:2206.14724},
  year   = {2023}
}

备注

Accepted at PETS 2023