SHAP@k:Top-k 特征的高效且可能近似正确(PAC)识别
机器学习
2023-07-12 v1 人工智能
摘要
SHAP 框架通过计算方法特征重要性,为解释模型预测提供了原则性方法。受金融应用驱动,我们引入 Top-k 识别问题(TkIP),其目标是识别具有最高 SHAP 值的 k 个特征。尽管任何带不确定性估计的 SHAP 值计算方法(如 KernelSHAP 与 SamplingSHAP)都可平凡地改造以解决 TkIP,但这样做样本效率极低。我们工作的目标是在解决 TkIP 的背景下提升现有方法的样本效率。我们的核心洞见是,TkIP 可框定为 Explore-m 问题——一个与多臂老虎机(MAB)相关的充分研究问题。这一联系使我们能通过借力 MAB 文献的两种技术提升样本效率:(1)更好的停止条件(停止采样)以识别何时满足 PAC(可能近似正确)保证;(2)贪心采样方案,在不同特征间审慎分配样本。采用这些方法,我们开发了 KernelSHAP@k 与 SamplingSHAP@k 以高效解决 TkIP,在大多数常见信用相关数据集上平均提升 的样本效率与运行时间。
引用
@article{arxiv.2307.04850,
title = {SHAP@k:Efficient and Probably Approximately Correct (PAC) Identification of Top-k Features},
author = {Sanjay Kariyappa and Leonidas Tsepenekas and Freddy Lécué and Daniele Magazzeni},
journal= {arXiv preprint arXiv:2307.04850},
year = {2023}
}