SHLIME:粉碎欺骗性攻击的 SHAP 与 LIME
机器学习
2025-08-18 v1 密码学与安全
摘要
后验解释方法,如 LIME 和 SHAP,提供对黑箱分类器的可解释见解,日益用于评估模型偏见和可泛化性。然而,这些方法容易受到对抗性操控,可能隐藏有害偏见。建立在 Slack 等人(2020)的工作基础上,我们研究了 LIME 和 SHAP 对于带偏见模型的易受攻击性,并评估了提高鲁棒性的策略。我们首先复制原始 COMPAS 实验以验证先前发现并建立基线。随后,我们引入一个模块化测试框架,系统性地评估增强型和集成解释方法在不同性能分类器上的表现。使用该框架,我们在分布外模型上评估多种 LIME/SHAP 集成配置,比较其抵御偏见隐藏能力与原始方法。我们的结果识别了显著提升偏见检测能力的配置,凸显了其在高风险机器学习系统部署中提升透明度的潜力。
引用
@article{arxiv.2508.11053,
title = {SHLIME: Foiling adversarial attacks fooling SHAP and LIME},
author = {Sam Chauhan and Estelle Duguet and Karthik Ramakrishnan and Hugh Van Deventer and Jack Kruger and Ranjan Subbaraman},
journal= {arXiv preprint arXiv:2508.11053},
year = {2025}
}
备注
7 pages, 7 figures