中文

使用 SHAP 解释深度学习模型需要平衡的背景与解释数据:一项关于临床决策的实证研究

机器学习 2022-06-10 v1 人机交互

摘要

目的:Shapley 加性解释(SHAP)是一种流行的用于解释黑盒模型的事后技术。尽管数据不平衡对预测模型的影响已被广泛研究,但其在基于 SHAP 的模型解释方面的影响在很大程度上仍属未知。本研究旨在调查数据不平衡对深度学习模型 SHAP 解释的影响,并提出缓解这些影响的策略。材料与方法:我们提出在利用 SHAP 解释黑盒模型时,调整背景数据与解释数据中的类别分布。我们的数据平衡策略是以类别均等分布来构成背景数据与解释数据。为评估数据调整对模型解释的影响,我们提出使用蜂群图作为定性工具来识别“异常”解释伪影,并定量检验变量重要性与预测能力之间的一致性。我们在一个使用医疗信息集市 for 重症监护(MIMIC-III)数据和多层感知机预测住院死亡率的实证研究中展示了所提方法。结果:使用数据平衡策略可让我们减少蜂群图中的伪影数量,从而缓解数据不平衡的负面影响。此外,采用平衡策略后,相应重要性排序中排名靠前的变量展现出更好的判别能力。讨论与结论:我们的研究结果表明,平衡的背景技术数据与解释数据有助于减少由偏斜数据分布引起的解释结果噪声,并提升变量重要性排序的可靠性。此外,这些平衡操作提升了 SHAP 在临床应用中识别具有异常特征患者的潜力。

关键词

引用

@article{arxiv.2206.04050,
  title  = {Balanced background and explanation data are needed in explaining deep learning models with SHAP: An empirical study on clinical decision making},
  author = {Mingxuan Liu and Yilin Ning and Han Yuan and Marcus Eng Hock Ong and Nan Liu},
  journal= {arXiv preprint arXiv:2206.04050},
  year   = {2022}
}