中文

反事实解释的隐私问题:解释关联攻击

机器学习 2022-10-24 v1 密码学与安全 计算机与社会

摘要

黑盒机器学习模型正被越来越多地用于高风险领域,这催生了对可解释人工智能(XAI)的日益增长的需求。遗憾的是,在机器学习中使用 XAI 引入了新的隐私风险,而这些风险目前在很大程度上未被察觉。我们提出了解释关联攻击,其可能发生在部署基于实例的策略以寻找反事实解释时。为应对此类攻击,我们提出了 k-匿名反事实解释,并引入纯粹度(pureness)作为一种新指标来评估这些 k-匿名反事实解释的有效性。我们的结果表明,使解释(而非整个数据集)满足 k-匿名,有利于解释的质量。

关键词

引用

@article{arxiv.2210.12051,
  title  = {The privacy issue of counterfactual explanations: explanation linkage attacks},
  author = {Sofie Goethals and Kenneth Sörensen and David Martens},
  journal= {arXiv preprint arXiv:2210.12051},
  year   = {2022}
}