中文

迈向基于解释的成员推断攻击的博弈论理解

人工智能 2024-04-11 v1 计算机科学与博弈论

摘要

模型解释提高了黑盒机器学习(ML)模型及其决策的透明度;然而,它们也可能被利用来实施隐私威胁,例如成员推断攻击(MIA)。现有工作仅在对手与目标ML模型之间的单一“假设”交互场景中分析了MIA;因此,它没有辨别在重复交互设置中影响对手发起MIA能力的因素。此外,这些工作依赖于对手对目标模型结构知识的假设,因此不能保证区分成员与非成员所需的预定义阈值的最优性。在本文中,我们深入研究了基于解释的阈值攻击领域,其中对手试图通过与包含目标ML模型及其相应解释方法的系统进行迭代交互,利用解释的方差来实施MIA攻击。我们通过采用连续时间随机信号博弈框架来建模这种交互。在我们的框架中,对手玩一个停止博弈,与系统(对对手的类型(即诚实或恶意)具有不完全信息)交互以获取解释方差信息,并计算最优阈值以准确确定数据点的成员身份。首先,我们提出了一个合理的数学公式来证明存在这样的最优阈值,可用于发起MIA。然后,我们刻画了在该动态系统中存在唯一马尔可夫完美均衡(或稳态)的条件。通过对我们提出的博弈模型进行全面的模拟,我们评估了在重复交互设置中可能影响对手发起MIA能力的各种因素。

关键词

引用

@article{arxiv.2404.07139,
  title  = {Towards a Game-theoretic Understanding of Explanation-based Membership Inference Attacks},
  author = {Kavita Kumari and Murtuza Jadliwala and Sumit Kumar Jha and Anindya Maiti},
  journal= {arXiv preprint arXiv:2404.07139},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2202.02659