基于SHAP的监督式聚类用于样本分类与广义瀑布图
机器学习
2025-10-13 v1 统计方法学
机器学习
摘要
在数据和技术日益增长的时代,大型黑箱模型正因其处理大量数据并学习复杂输入-输出关系的能力而成为常态。然而,这些方法的缺陷在于其无法解释预测过程,使得它们不可信且在高风险情境中使用颇为谨慎。SHapley Additive exPlanations (SHAP)分析是一种日益流行的可解释人工智能方法,因其能够以原始特征术语解释模型预测而受到青睐。对于数据集中的每个样本和特征,我们将一个SHAP值关联,以量化该特征对该样本预测的贡献。对这些SHAP值进行聚类可提供对数据见解,通过对不仅获得相同预测的样本,还对获得相同预测原因相似的样本进行分组。在做到此同时,我们映射了不同样本到达相同预测的各种路径。为展示这一方法论,我们提出了一个模拟实验,除了一个使用阿尔弗雷德·戴维斯神经影像数据库 (ADNI) 数据的案例研究。我们还提出了一种用于多分类的新型瀑布图的概括。
引用
@article{arxiv.2510.08737,
title = {SHAP-Based Supervised Clustering for Sample Classification and the Generalized Waterfall Plot},
author = {Justin Lin and Julia Fukuyama},
journal= {arXiv preprint arXiv:2510.08737},
year = {2025}
}
备注
23 pages, 15 figures, 3 tables