中文

SHLIME:粉碎欺骗性攻击的 SHAP 与 LIME

机器学习 2025-08-18 v1 密码学与安全

摘要

后验解释方法,如 LIME 和 SHAP,提供对黑箱分类器的可解释见解,日益用于评估模型偏见和可泛化性。然而,这些方法容易受到对抗性操控,可能隐藏有害偏见。建立在 Slack 等人(2020)的工作基础上,我们研究了 LIME 和 SHAP 对于带偏见模型的易受攻击性,并评估了提高鲁棒性的策略。我们首先复制原始 COMPAS 实验以验证先前发现并建立基线。随后,我们引入一个模块化测试框架,系统性地评估增强型和集成解释方法在不同性能分类器上的表现。使用该框架,我们在分布外模型上评估多种 LIME/SHAP 集成配置,比较其抵御偏见隐藏能力与原始方法。我们的结果识别了显著提升偏见检测能力的配置,凸显了其在高风险机器学习系统部署中提升透明度的潜力。

关键词

引用

@article{arxiv.2508.11053,
  title  = {SHLIME: Foiling adversarial attacks fooling SHAP and LIME},
  author = {Sam Chauhan and Estelle Duguet and Karthik Ramakrishnan and Hugh Van Deventer and Jack Kruger and Ranjan Subbaraman},
  journal= {arXiv preprint arXiv:2508.11053},
  year   = {2025}
}

备注

7 pages, 7 figures