中文

利用基于 GAN 的私有反事实解释进行基于知识蒸馏的模型提取攻击

机器学习 2024-10-23 v2 人工智能 密码学与安全 计算机与社会

摘要

近年来,机器学习(ML)模型即服务在多样化的生产软件应用中的部署显著增加。与此同时,可解释 AI(XAI)持续发展,以应对 ML 模型对透明度和可信度的需求。XAI 技术旨在通过提供关于模型决策过程的见解(以模型解释的形式)来增强 ML 模型的透明度。同时,一些 MLaaS 平台现在在 ML 预测输出之外还提供解释。这种设置引发了对 MLaaS 漏洞的担忧,特别是与模型提取攻击等隐私泄露攻击相关的担忧。这是因为解释可能会揭示有关模型内部运作的见解,从而被恶意用户利用。在本工作中,我们重点研究如何利用模型解释,特别是反事实解释,在 MLaaS 平台内执行 MEA。我们还深入评估了将差分隐私作为缓解策略的有效性。为此,我们首先提出了一种基于知识蒸馏的新型 MEA 方法,以提高在利用 CF 时提取目标模型替代模型的效率,而攻击者无需了解任何训练数据分布的知识。然后,我们提出了一种结合 DP 训练 CF 生成器的方法,以生成私有 CF。我们在真实世界数据集上进行了彻底的实验评估,并证明与基线方法相比,我们提出的基于 KD 的 MEA 可以用更少的查询次数产生高保真度的替代模型。此外,我们的研究结果表明,加入隐私层可以缓解 MEA。然而,这会牺牲 CF 的质量,从而影响解释的性能。

关键词

引用

@article{arxiv.2404.03348,
  title  = {Knowledge Distillation-Based Model Extraction Attack using GAN-based Private Counterfactual Explanations},
  author = {Fatima Ezzeddine and Omran Ayoub and Silvia Giordano},
  journal= {arXiv preprint arXiv:2404.03348},
  year   = {2024}
}

备注

19 pages