中文

AUTOLYCUS:利用可解释人工智能(XAI)对可解释模型实施模型提取攻击

机器学习 2024-07-10 v3 密码学与安全

摘要

可解释人工智能(XAI)旨在揭示人工智能模型的决策过程。然而,用于此类解释的数据可能带来安全和隐私风险。现有文献识别了针对机器学习模型的攻击,包括成员推断攻击、模型逆向攻击和模型提取攻击。这些攻击根据设置和涉及方的不同,针对模型或训练数据。XAI 工具可能增加模型提取攻击的脆弱性,当模型所有者偏好黑盒访问从而保持模型参数和架构私有时,这是一个值得关注的问题。为了利用这一风险,我们提出了 AUTOLYCUS,一种在黑盒设置下针对可解释模型的新型基于重训练(学习)的模型提取攻击框架。作为 XAI 工具,我们利用局部可解释模型无关解释(LIME)和 Shapley 值(SHAP)来推断决策边界,并创建复制目标模型功能的替代模型。选择 LIME 和 SHAP 主要是因为它们提供现实且信息丰富的解释,同时被广泛采用、简单且易用。我们在六个机器学习数据集上评估了 AUTOLYCUS,测量了替代模型相对于目标模型的准确度和相似度。结果表明,AUTOLYCUS 非常有效,与最先进的攻击相比,所需查询次数显著减少,同时保持了相当的准确度和相似度。我们在多种可解释机器学习模型上验证了其性能和可迁移性,包括决策树、逻辑回归、朴素贝叶斯和 k 近邻。此外,我们还展示了 AUTOLYCUS 针对所提出的对抗措施的鲁棒性。

关键词

引用

@article{arxiv.2302.02162,
  title  = {AUTOLYCUS: Exploiting Explainable AI (XAI) for Model Extraction Attacks against Interpretable Models},
  author = {Abdullah Caglar Oksuz and Anisa Halimi and Erman Ayday},
  journal= {arXiv preprint arXiv:2302.02162},
  year   = {2024}
}

备注

This work is published in the Proceedings on Privacy Enhancing Technologies (PoPETs), Vol. 2024, Issue 4, 2024